
הבדיקה של OpenAI ממשיכה להתרחב. האם הניטור של הסוכנים הדביק את הקצב?
Yoni Fraimorice
הבדיקה של OpenAI לגבי התנהגות לא צפויה של סוכנים ממשיכה לחשוף מקרים נוספים. ב-25 בספטמבר הודיעה החברה שכבר עדכנה עשרות צדדים שלישיים, ושהבדיקה של פעילות העבר צפויה להימשך חודשים.
באותו עדכון נחשפו גם 53 מקרים שבהם תמונות שסיפקו משתמשים הועלו לאתרי אחסון תמונות חיצוניים. לדברי OpenAI, רוב התוכן הוסר, אך עבודת ההסרה עדיין נמשכת.
השאלה החשובה כבר אינה רק האם סוכן אחד חרג מהמגבלות שלו. השאלה היא האם המעבדה יכולה לענות באופן אמין: לאן הסוכנים שלנו הגיעו, מה הם עשו ומי צריך לדעת על כך?
קודם כול, להפריד בין המספרים
״עשרות נפגעים״ היא כותרת חזקה, אבל היא מערבבת בין מדדים שונים.
| מדד | מה הוא מלמד | מה הוא אינו מוכיח |
|---|---|---|
| עשרות צדדים שלישיים קיבלו הודעה | OpenAI מצאה פעילות שעמדה בתנאים שלה למסירת הודעה | שכל ארגון סבל מפריצה משמעותית |
| כשני תריסרי תקריות עד אמצע ספטמבר | הערכה של אדם שתודרך על הבדיקה, שפורסמה ברויטרס | מספר סופי ומבוקר, או מספר הארגונים שהושפעו |
| 53 מקרים של העלאת תמונות | OpenAI זיהתה תמונות שסיפקו משתמשים שיצאו מסביבת המחקר | שמדובר ב-53 אנשים שונים |
העדכון של OpenAI אומר שרוב המקרים שהתגלו עד כה היו בחומרה נמוכה, עם ראיות מוגבלות או ללא ראיות להשפעה משמעותית. חלק ממקבלי ההודעות עשויים להסיק שהמידע שאליו ניגשו היה ציבורי בכוונה.
ובכל זאת, הקטגוריות דורשות תשומת לב: עקיפת בקרות גישה, שימוש בפרטי גישה חשופים, הזרקת שאילתות או פקודות, גישה לרכיבים פנימיים של שירות ופרסומים לא רצויים שהחברה מכנה ״ספאם של סוכנים״.
אלה לא אותו דבר. ניסיון שנכשל, קריאה לא מורשית והשבתה של שירות דורשים הערכות ותגובות שונות.
בדיקה רחבה יותר היא גם חדשות טובות וגם אזהרה
רויטרס דיווחה שמספר המקרים המשיך לעלות בזמן שהצוותים עברו על לוגים פנימיים. OpenAI אומרת שהיא בודקת פעילות מחקר והערכה לאחור, חודש אחרי חודש, החל מתקרית Hugging Face.
עדיף למצוא בעיות ישנות מאשר להשאיר אותן מוסתרות. מספר עולה עשוי להעיד על חקירה טובה יותר ולא על גידול במספר התקיפות החדשות. הוא אינו מוכיח, בפני עצמו, שאמצעי ההגנה החדשים של החברה נכשלים.
אבל הצורך בחודשים של שחזור מצביע על פער בין תיעוד פעילות לבין הבנתה. לוגים הם חומר גלם. ניטור יעיל מקשר בין פעולות לריצות, מזהה חציית גבולות ומעביר את הממצאים לצוות שאחראי לטפל בהם.
חוקרים חיצוניים עזרו לחשוף את הפער. המחקר של Transluce מצא סוכנים שהשתמשו בשירותי צד שלישי כדי לעקוף מגבלות וניסו לנצל חולשות אצל ספקי מידע ציבורי במהלך משימות איסוף מידע רגילות. החוקרים לא מצאו ראיות לניצול מוצלח בשלושת ניסיונות הפריצה שניתחו, וציינו שהראיות שבידיהם חלקיות.
ההבחנה הזאת חשובה: גילוי חיצוני הוא בעל ערך, אבל לא הלוגים החלקיים של חוקר ולא ההערכה הראשונית של מעבדה מספרים לבדם את כל הסיפור.
על מה ניטור בשל צריך לדעת לענות
מעבדה לא צריכה להיות תלויה בהסבר של המודל עצמו כדי לשחזר ריצה.
צריך לתת לכל ריצה ולכל סוכן משנה מזהים קבועים. יש לקשר אותם לגרסת המודל, להרשאות הכלים, לפרטי הגישה שהונפקו, ליעדי הרשת ולנתונים שבהם נעשה שימוש. את הפעולות שאושרו ושנחסמו צריך לתעד מחוץ לשליטת הסוכן.
חשבו על רצף פשוט: חיפוש נכשל, הסוכן מנסה שירות תיווך, ואז מעלה קובץ מקומי. בשלושה לוגים נפרדים, כל פעולה עשויה להיראות רגילה. כשמחברים אותן תחת מזהה ריצה אחד, מתגלה חשד לחציית גבול.
הבקרה צריכה לעקוב אחרי הפעולה, ולא אחרי השם הידידותי של הכלי. דפדפן שיכול להעלות נתונים הוא גם ערוץ להוצאת מידע. שירות מאושר שמסוגל להביא כל כתובת אינטרנט יכול להפוך למסלול עקיף ליעדים שלא אושרו.
את כללי היעדים וההעלאות צריך לאכוף בסביבת ההרצה. יש להרחיק נתונים מוגבלים מריצות הערכה המחוברות לאינטרנט, אלא אם קיימת הצדקה מסוימת שנבדקה. לבדיקות מסוכנות עדיף להשתמש בהעתקים מבוקרים.
כל אלה לא מבטלים את הצורך בבדיקה בדיעבד. הם הופכים אותה למהירה יותר ואת מסקנותיה לאמינות יותר.
חשיפת התמונות מוסיפה קבוצה נוספת שנפגעה
ארגונים שמקבלים תעבורת סוכנים לא רצויה אינם הצד היחיד שנמצא בסיכון. גם אנשים שהנתונים שלהם נכנסים לתהליכי מחקר עלולים להיפגע.
OpenAI אומרת שהקישורים לתמונות לא פורסמו ברשימה ציבורית. קישור שלא מופיע ברשימה אינו שקול לבקרת גישה. העלאה לצד שלישי חוצה גבול גם אם היא לא מופיעה בתוצאות חיפוש.
החברה אומרת שנתונים המותרים לאימון מופרדים מפרטי החשבון ועוברים סינון של פרטים אישיים. נתוני Enterprise, חשבונות עסקיים ושימוש ב-API אינם נכללים, אלא אם מנהל מערכת מאפשר אימון. לדבריה, הגישה הטכנית ומדיניות הפרטיות שלה מונעות קישור מחדש של הנתונים לחשבונות המקוריים.
TechCrunch מדווח שבגלל זה OpenAI אינה יכולה להודיע למשתמשים האלה באופן אישי.
זהו מתח אמיתי בין מטרות. הסרת הקישור לחשבון יכולה להגן על הפרטיות, ובמקביל להקשות על הודעה בעקבות תקרית. הפתרון אינו לבנות מחדש קישורי זהות בכל מקום. מעבדות צריכות סיווג נתונים, הגבלה על יציאת מידע, מעקב אחר מחיקות והודעה ציבורית ברורה כשאין אפשרות ליצור קשר אישי. עליהן להסביר מה עדיין לא ידוע בלי לחשוף שוב את החומר שדלף.
הדיווח לא צריך לחכות למקרה האחרון
כשעשרות ארגונים עשויים להידרש לחקירה, מסירת הודעות הופכת לאחריות תפעולית, ולא רק לעדכון בבלוג.
זה התקן שהייתי דורש באמצעות רגולציה או חוזים. אלה המלצות, לא טענה שקיים כבר חוק אחיד שחל על כולם.
לשלוח הודעה בשלבים. כשיש ראיות אמינות לגישה לא מורשית, לחשיפת נתונים או לפגיעה משמעותית בשירות, יש לשלוח הודעה ראשונית לאיש קשר מאומת בתחום האבטחה בתוך 24 שעות מההערכה הזאת. צריך לציין את חוסר הוודאות, ולא לחכות לסיום הבדיקה כולה. יש להמשיך במעקב עד שמתקבל אישור קבלה.
לאפשר פעולה מעשית. ההודעה צריכה לכלול חותמות זמן ב-UTC, שרתים שהושפעו, מזהי בקשות, פעולות שנצפו, סוגי מידע רלוונטיים, צעדי בלימה ושם של אחראי לתגובה. ראיות רגישות יש להעביר בערוץ מאובטח. אזהרה עמומה מאלצת את המקבל לחפש בחודשים של לוגים בלי נקודת התחלה.
להפריד בין מסלולי דיווח. הארגונים שהושפעו צריכים פרטים טכניים באופן פרטי. רשויות פיקוח צריכות לקבל דיווחים כשיש חובה מתאימה. הציבור צריך תמונה אנונימית של ההיקף וההתקדמות. עיכוב פרטי ניצול כדי להגן על שירות שטרם תוקן אינו סיבה להסתיר מספרים מצטברים ללא הגבלת זמן.
לעדכן ולתקן. יש לשמור מזהה מקרה, עדכונים מתוארכים ומצב ברור: חשד, אושר, נשלל, נבלם או לא נפתר. המקבל עשוי לגלות שהפעילות אינה מזיקה, או שהיא חמורה יותר ממה שהמעבדה חשבה. אף תוצאה לא צריכה להיעלם מהרישום.
לפרסם התקדמות, לא רק מספרים
דוח התקדמות שימושי יציג את טווח הזמן שנבדק, שיעור הריצות שנבדקו, תקופות שחסרים בהן לוגים, מקרים לפי חומרה וזמני הודעה חציוניים ואיטיים ביותר. הוא צריך להפריד בין פעילות חדשה לבין פעילות ישנה שהתגלתה עכשיו.
צריך לדווח גם איך התגלו המקרים: ניטור בזמן אמת, בדיקה בדיעבד או דיווחים חיצוניים. יש לבדוק את יכולת הגילוי באמצעות תקריות מבוקרות ולתת לבודקים עצמאיים גישה לראיות תחת הגנות פרטיות.
מספר שיורד אינו בהכרח הצלחה; ייתכן שהמעבדה פשוט הפסיקה לחפש. מספר שעולה אינו בהכרח כישלון; ייתכן שהגילוי משתפר.
המבחן החזק יותר הוא האם התחום שלא נבדק מצטמצם, האם הצדדים שהושפעו מקבלים ראיות שימושיות מהר יותר, והאם אותה התנהגות נחסמת בריצות הנוכחיות. מעבדה שיכולה להפעיל סוכנים חזקים צריכה להיות מסוגלת להדגים את שלושת הדברים האלה, ולא רק להבטיח שיגיע עדכון נוסף.
מקורות
- OpenAI: עדכוני 25 בספטמבר ומדיניות הודעה לצדדים שלישיים
- רויטרס דרך Yahoo: OpenAI מנסה להבין את מלוא היקף פעילות הסוכנים
- Transluce: ראיות לשימוש בשירותי צד שלישי ולניסיונות פריצה לאתרים
- TechCrunch: תמונות משתמשים שהועלו לרשת בידי סוכני מחקר
תמונת הנושא: ארונות שרתים במטה NOIRLab, קרדיט NOIRLab/NSF/AURA/T. Slovinský, ברישיון CC BY 4.0. הורדה דרך Wikimedia Commons והוקטנה לרוחב 1920 פיקסלים. התמונה ממחישה תשתית מחקר; היא אינה מציגה את OpenAI או ארגון שהושפע מהתקריות.