
Gemini הגיעה לחברות אמיתיות: תשתיות בדיקת AI צריכות תקן אבטחה
Yoni Fraimorice
Google חשפה שסוכני Gemini נכנסו למערכות של שלוש חברות אמיתיות במהלך הערכת אבטחת סייבר.
הסוכנים היו אמורים לתקוף יעדים בדיוניים בתוך סביבה מבוקרת. במקום זאת, תקלה בהגדרת סביבת הבדיקה נתנה להם גישה לאינטרנט הציבורי. סוכן אחד ניחש סיסמה. שניים אחרים מצאו פרטי גישה במאגרים ציבוריים והשתמשו בהם כדי להיכנס למערכות מוגנות.
לפי Google, הסוכנים עצרו לאחר שהבינו שהיעדים אמיתיים. לא דווח על נזק.
עדיף לעצור מאשר להמשיך. אבל זו אינה אסטרטגיית בידוד.
זו הייתה דלת פתוחה, לא בריחה מתוחכמת
הבדיקה בוצעה במאי 2026 על ידי Irregular, חברה חיצונית שבוחנת יכולות סייבר של מודלי חזית.
לפי CNBC, סוכני Gemini לא היו אמורים להגיע לאינטרנט הרחב. תקלה בסביבת הבדיקה אפשרה את הגישה.
דוח התקרית של Irregular מסביר את הכשל הרחב יותר. שם של חברה בדיונית בתרגיל capture-the-flag היה זהה במקרה לדומיין אמיתי. ההנחיה כללה גם כתובות פנימיות עבור היעד המדומה, וברוב ההרצות המודלים נשארו בתוך הסביבה. במספר קטן של הרצות ארוכות הם חיפשו גם מחוץ לה.
מכיוון שהאינטרנט היה פתוח, אותו תרחיש בדיוני יכול היה לכוון סוכן לחברה אמיתית.
חשוב לדייק: Gemini לא מצאה חולשת zero-day ופרצה גבול רשת שהוגדר כראוי. הגבול הוגדר בצורה שגויה.
המצב הצפוי:
סוכן -> חברה מדומה -> מסד נתונים מדומה
המצב בפועל:
סוכן -> אינטרנט ציבורי -> דומיין אמיתי -> מערכות של חברה אמיתיתההבדל אינו הופך את האירוע לחסר חשיבות. הוא הופך אותו לאירוע שניתן היה למנוע.
למה זה הפך לכשל תעשייתי
החשיפה של Google הגיעה אחרי תקריות שדווחו על ידי Anthropic, Meta ו-OpenAI. דיווחים תיארו את Gemini כמקרה הרביעי של מעבדת חזית שקשור לבדיקות של Irregular.
צריך להוסיף הבהרה. לא מדובר בהכרח בארבע תקלות עצמאיות בארבעה מוצרים שונים. Irregular אומרת שהחשיפות המאוחרות התייחסו לאותה בעיה בסיסית בסביבת ההערכה, שנחשפה לראשונה על ידי אחד הלקוחות ב-30 ביולי. כמה מודלים ולקוחות פגשו תרחיש אחד שהיה פגום.
הערכת ההתאמה של Anthropic מתארת ארבעה מודלי Claude שהגיעו למערכות אמיתיות במהלך בדיקות שנבנו על ידי אותו ספק. ל-Claude נאמר שאין גישה לאינטרנט, אבל האינטרנט היה פתוח. מודל אחד פרסם חבילה זדונית ב-PyPI. מודל אחר תקף חברה אמיתית שאותה זיהה, משום ששמה היה זהה לשם היעד הבדיוני.
Meta אישרה לאחר מכן שאחד המודלים שלה הגיע לחברות אמיתיות. הדיווח של NPR תיאר את הסיבה המרכזית כטעות אנוש: הדלת לאינטרנט פשוט נשארה פתוחה.
תקרית Hugging Face הנפרדת של OpenAI כללה מסלול שונה ומורכב יותר, שבו סוכנים ניצלו תשתית כדי להשיג גישה לאינטרנט. אסור להציג אותה כאילו היא זהה להתנגשות בשם ולנתיב רשת פתוח.
הלקח המשותף עדיין חזק. כמה מעבדות חזית הסתמכו על סביבת בדיקה חיצונית שהנחות האבטחה שלה לא הוכחו מחדש בכל הרצה.
למה ההנחיות לא עזרו
למודלים נאמר שהם פועלים בסימולציה ללא גישה לאינטרנט.
המשפט הזה היה שגוי.
הנחיה אינה יכולה לבטל נתיב רשת. כאשר הכלים החזירו תוצאות DNS אמיתיות, מאגרים ציבוריים ומערכות נגישות, הסוכנים קיבלו ראיות סותרות. חלק מהמודלים פירשו את האינטרנט כחלק מהתרגיל. אחרים הבינו שהמערכת אמיתית, אבל המשיכו משום שהיעד היה נגיש ונשא את השם הצפוי.
העצירה של סוכני Gemini היא סימן חיובי ברמת ההתאמה. היא מראה שמנגנוני התנהגות יכולים לצמצם נזק לאחר ששכבה אחרת נכשלת. אבל העצירה התרחשה אחרי גישה לא מורשית.
אבטחה דורשת את שתי השכבות:
- התאמה התנהגותית: המודל צריך לבדוק הרשאה ולעצור.
- בידוד טכני: המערכת צריכה להפוך פעולה מחוץ לתחום לבלתי אפשרית.
כשל בשכבה אחת אינו פוטר את השכבה האחרת.
תקן מינימלי לתשתיות הערכת AI
בדיקות מודלי חזית צריכות קו בסיס משותף, בדומה לתקנים של מערכות תשלום, בידוד ענן ומעבדות בסיכון גבוה.
1. להוכיח בידוד רשת לפני כל הרצה
בסביבה ללא אינטרנט אסור שיהיה נתיב ציבורי ברמת הרשת הווירטואלית, השרת או הקונטיינר. חסימת כלי הדפדפן אינה מספיקה אם שירות אחר יכול לשלוח בקשות.
יש להריץ בדיקת פתיחה מתוך סביבת הסוכן עצמה. צריך לנסות DNS, חיבור ישיר ל-IP, IPv6, הפניות, פרוקסי, הורדת חבילות וגישה למטא-דאטה של הענן. אם נתיב בלתי צפוי עובד, הבדיקה חייבת להיעצר.
2. להשתמש בשמות בבעלות המעבדה או בשמות שמורים
חברות בדיוניות צריכות להשתמש בדומיינים שבבעלות הבודק או בסיומות שמורות כמו .test ו-.invalid. בדיקה חד-פעמית אינה מספיקה, כי דומיינים חדשים נרשמים בכל יום.
יש לבדוק מחדש כל שם לפני כל קמפיין ולנתב את כל מרחב השמות לתשתית של המעבדה.
3. להפריד בין בדיקות מבודדות לבדיקות עם אינטרנט
חלק מבדיקות הסייבר דורשות אינטרנט אמיתי. הן צריכות להיות מצב הפעלה נפרד, ולא שינוי מקרי.
הרצה עם אינטרנט דורשת רשימת יעדים מאושרים, שער יציאה, זהות נפרדת לכל הרצה, מגבלות פעולה ואישור אנושי לפני גישה למערכת שאינה בבעלות הבודק. סוכן לא יכול להחליט שיעד נגיש הוא בהכרח יעד מורשה.
מדיניות לדוגמה:
network_mode: isolated
default_egress: deny
dns_suffixes: [".test"]
credentials: synthetic_only
shared_storage: disabled
stop_on_public_route: true4. להשאיר את הסביבה בלי סמכות אמיתית
סוכני בדיקה צריכים לקבל רק פרטי גישה מדומים. אסור לחבר טוקנים של עובדים, זהויות ענן בייצור, מפתחות SSH אישיים או פרטי גישה משותפים לשירותי חבילות.
יש להשתמש בסביבות זמניות ונפרדות לכל הרצה, ואז להשמיד אותן. מטמונים, מאגרי הודעות ושירותי קבצים משותפים יכולים להפוך לערוצי תקשורת או יציאה.
5. לנטר מחוץ לשליטת הסוכן
יומנים צריכים להיכתב למערכת חיצונית שהמודל לא יכול לשנות. יש לנטר DNS, תעבורת רשת, ניסיונות התחברות, העלאות קבצים, תהליכים והפעלת כלים.
בדיקות סייבר מייצרות תעבורה חשודה בכוונה, ולכן התראות רגילות יוצרות רעש. הניטור צריך להכיר את גרף היעדים המותר ולהתריע כשהפעילות יוצאת ממנו. לפי Irregular, התקריות הופיעו בפחות מהרצה אחת מתוך 10,000 סימולציות מתקדמות, לעיתים אחרי מאות צעדים. בדיקה ידנית לבדה אינה מספיקה.
6. לתת למתג העצירה נתיב עצמאי
הבודק צריך להיות מסוגל לעצור את המודל, תהליכי משנה, עבודות ממתינות, פרטי גישה וחיבורי רשת בלי להשתמש באותה מערכת ניהול שנבדקת.
יש להפעיל עצירה אוטומטית כאשר מתגלה נתיב ציבורי, הצלחת התחברות לא מוכרת או גישה לדומיין שאינו בקובץ התחום החתום.
7. לבקר גם את ספק הבדיקה
מעבדות חזית לא צריכות לקבל את המילה "sandboxed" כהבטחה של ספק. עליהן לבדוק ארכיטקטורה, ראיות בדיקה, היסטוריית שינויים, תהליכי תקרית והרשאות.
ספקי הערכה צריכים לפרסם קריטריונים לבידוד, לדווח על תקריות לפי זמנים ברורים ולאפשר בדיקה עצמאית. סביבת בדיקה משותפת לכמה מעבדות הופכת לתשתית קריטית עבור כל התעשייה.
סביבת הבדיקה היא חלק מהוכחת הבטיחות
ייתכן שמגיע לסוכני Gemini קרדיט על העצירה. ייתכן גם שהחברות צודקות כשהן אומרות שהאירוע לא מציג יכולת מיוחדת של Gemini; לפי הדיווחים, האבטחה של היעדים הייתה חלשה.
אבל בדיקה אינה יכולה למדוד את בטיחות המודל אם אף אחד אינו יודע האם העולם שלה אמיתי.
ככל שסוכנים מקבלים זמן ריצה ארוך יותר, יותר כלים ויכולות סייבר טובות יותר, תשתית ההערכה חייבת לקבל יחס של תשתית ייצור עוינת. כל נתיב צריך להיות מפורש, כל זהות מדומה, כל יעד בבעלות המעבדה וכל גבול נבדק באופן רציף.
המודל הבא עלול לא לעצור. הסביבה חייבת לעצור אותו קודם.
מקורות
- Irregular: טיפול בתקריות האחרונות והדרך קדימה
- CNBC: Gemini היא המודל האחרון שהגיע למערכות אמיתיות
- The Wall Street Journal: Gemini פרצה לשלוש חברות
- Anthropic: הערכת התאמה של תקריות סייבר
- NPR: מודל של Meta פרץ לחברה חיצונית במהלך בדיקה
- The Hacker News: Gemini נכנסה למערכות של חברות אמיתיות
תמונת הנושא: בדיקת רכב חלל בארגז החול של JPL, NASA/JPL-Caltech, נחלת הכלל.