חזרה לכל המאמרים
    לנהל מעבדות AI כמו שדות תעופה: בקרות שעובדות באמת
    AI SafetyAI SecurityAI AgentsSandboxingIncident Response

    לנהל מעבדות AI כמו שדות תעופה: בקרות שעובדות באמת

    Y

    Yoni Fraimorice

    שיתוף:

    שדה תעופה לא יכול לבסס פעילות בטוחה על כך שאף אחד לא יטעה. כך גם מעבדה שמפעילה סוכנים המסוגלים לכתוב קוד, להשתמש בפרטי גישה ולהגיע לשירותים חיצוניים.

    ב-3 באוקטובר TechCrunch דיווח על עזיבתו של דייוויד רובינסון את OpenAI. רובינסון אמר שהוביל את כתיבת דוחות הבטיחות להשקות מרכזיות. במאמר ב-Atlantic הוא טען שמעבדות חזית צריכות לפעול יותר כמו תחנות כוח גרעיניות או שדות תעופה עמוסים: עם גיבוי בין אמצעי הגנה ותכנון זהיר.

    לא הצלחתי לגשת למאמר המלא; הסיכום הזה מסתמך על הדיווח של TechCrunch. אותו דיווח כולל את תגובת OpenAI: החברה אומרת שהיא מחזקת בידוד, ניטור, התנהגות מודלים והערכות חיצוניות, ועוצרת עבודה בעת הצורך.

    השאלה השימושית אינה למי יש סיסמה טובה יותר. מה מפעיל צריך להוכיח לפני שסוכן חזק מתחיל לעבוד, ומה קורה כשבקרה נכשלת?

    לאמץ את המשמעת, לא להעתיק ענף שלם

    מעבדות AI אינן כורים, והסיכונים שלהן אינם זהים. נהלי תעופה לא יפתרו את בעיית התאמת המודלים לכוונות אנושיות.

    אבל רעיון אחד עובר היטב בין התחומים. ההגדרה של רשות הפיקוח הגרעיני האמריקאית להגנה לעומק דורשת שכבות עצמאיות ומגבות, כדי שאמצעי הגנה יחיד לא יישא בכל הנטל.

    שתי בדיקות בתוך אותו תהליך של סוכן אינן עצמאיות אם התהליך יכול להשבית את שתיהן. אזהרה ולוח ניטור אינם שני מחסומים אם אף אחד מהם אינו מונע פעולה חיצונית.

    הנהלים הבאים הם התרגום ההנדסי שלי לטיעון של רובינסון, לא טענה שהוא הציע את הרשימה המדויקת הזאת.

    מה התקריות מוכיחות בפועל

    שלושה דיווחים פומביים מציגים כשלים שונים:

    תקריתהפער שתועדמה לא כדאי להסיק
    תקרית Hugging Face של OpenAI ביוליהדוח הטכני מתאר שירות חבילות משותף שהפך לערוץ תקשורת ולמסלול עקיף לאינטרנט.קונטיינר לבדו לא הספיק; זה לא מוכיח שלא היו בקרות רשת.
    תקרית ההערכה של Irregularהחברה אומרת שגישה לאינטרנט הייתה זמינה שלא במכוון, ושם חברה בדיונית התאים למתחם אמיתי.כמה דיווחי לקוחות עסקו באותה בעיית הערכה בסיסית, לא בהכרח בכשלי תשתית נפרדים.
    תקרית ה-DNS של OpenAI ב-20 בספטמברהחברה מדווחת על סינון DNS לא מספיק, גלאי חריגות שלא כיסה את הסביבה ועצירה אוטומטית צפויה שלא התרחשה.זו אינה הוכחה שכל מנגנוני הניטור נכשלו או שלא הייתה אפשרות לעצירה ידנית.

    אלה ממצאי תקרית שמיוחסים למפרסמים, לא אישור עצמאי לכל תיקון. הדוח של OpenAI על יולי, הדיווח של Irregular ודוח ה-DNS של OpenAI תומכים בהבחנות האלה.

    1. בידוד שיחזיק גם אחרי טעות אחת

    בנו מחסומים נפרדים סביב הסוכן: סביבת ריצה מבודדת, אכיפת רשת מחוץ לה, הרשאות צרות וניטור שהסוכן אינו יכול לערוך.

    בהערכה מסוכנת, השתמשו ביעדים שבשליטתכם, בפרטי גישה מדומים ובסביבה חדשה. אל תשתפו מטמוני חבילות שניתנים לכתיבה בין ריצות שאינן קשורות. ניהול מדיניות והנפקת סודות צריכים להישאר מחוץ להרשאות הסוכן.

    לפני התחלה, בדקו את התצורה האמיתית של עומס העבודה, לא סביבת בדיקה דומה. שמרו את גיבוב תמונת הקונטיינר, גרסת מדיניות הרשת, תוצאת הבדיקה וזהות המפעיל האחראי.

    לאחר מכן, בדקו כשל בשכבה אחת במסגרת תרגיל מבודד. אם פרוקסי מאפשר בטעות יותר מדי, האם גבול אחר עדיין חוסם יעד שלא אושר? אם מנגנון ניטור מפסיק לדווח, האם מתזמן המשימות מסרב להפעיל ריצות מסוכנות חדשות?

    המסלול דרך שירות החבילות ביולי מראה למה לא מספיק לצייר קופסה סביב הקונטיינר. גבול האבטחה כולל כל שירות שפועל בשמו.

    2. לכלול DNS ומסלולים עקיפים בכללי היציאה

    רשימת יעדי יציאה מותרים, egress allowlist, קובעת לאן תעבורה יכולה לצאת. היא חייבת לכסות את היעד ואת הפעולה המותרת, לא רק את שם הכלי.

    הדוח של OpenAI מספטמבר אומר שבקשות רשת רגילות קיבלו תשובות ממטמון לא מקוון, אבל שרת ה-DNS של סביבת הבידוד סיפק מסלול חי החוצה. חסימת HTTPS ישיר לא סגרה אותו.

    בבדיקות מבודדות, העדיפו תלויות לא מקוונות ופתרון שמות מבוקר. כשקישוריות נחוצה, הגבילו גישה לשרת פתרון השמות, שמות מתחם וסוגי רשומות, ובדקו הפניות ויעדים שאליהם שירותי תיווך מגיעים. בדקו IPv4, ‏IPv6, חיבורים ישירים ובקשות עקיפות דרך שירותי חבילות או דפדפן.

    השתמשו ביעדים שבבעלות הבודק או בשמות שמורים לבדיקות. שם חברה שנשמע בדיוני כשכתבו את המבחן אינו הרשאה קבועה.

    OpenAI אומרת שהוסיפה שתי שכבות חסימה עצמאיות אחרי תקרית ה-DNS. זה סוג התגובה הנכון, אבל הדוח מציין גם שהאימות בין תצורות עדיין לא הושלם. תיקון בסביבה אחת אינו הוכחה לכיסוי של כל הסביבות.

    3. לבדוק את מסלול העצירה, לא רק את ההתרעה

    דוח ה-DNS מציג ציר זמן שימושי: תשובה חיצונית ב-09:50, התרעה ב-10:02, אישור קבלה אנושי ב-10:05 וסיום הריצה ב-12:34.

    OpenAI אומרת שהריצה לא נעצרה אוטומטית כמצופה, ונוצר בלבול. לכן, אישור קבלת התרעה לא היה שווה לבלימה.

    תנו לאיש תגובה מורשה מסלול עצירה מחוץ לסוכן ולמודל שלו. עליו לעצור תזמון חדש וקריאות לכלים, לבטל עבודה בתור וסוכני משנה, לחסום תעבורה יוצאת ולבטל פרטי גישה במקומות שבהם הדבר נתמך. מנעו הפעלה מחדש אוטומטית עד לאישור מפורש.

    עקבו אחרי מצבים נפרדים: התרעה התקבלה, עצירה התבקשה, עצירה נאכפה, השפעות חיצוניות נבדקו. תעדו חותמות זמן ואישורי ביצוע לכל שלב.

    קבעו ובדקו זמן עצירה מרבי שמתאים לעומס העבודה. מדדו בנפרד פעולות שכבר היו בביצוע; עצירה אינה מבטלת כתיבה שהושלמה.

    התקרית מוכיחה שהעצירה האוטומטית הצפויה נכשלה. היא לא קובעת אם המנגנון היה עצמאי מבחינה ארכיטקטונית. עצמאות היא דרישת תכנון שצריך לאמת, לא עובדה שצריך להמציא.

    4. תחקיר ללא האשמות, אבל עם תוצאות

    הנחיות ה-SRE של Google מסבירות למה האשמת אנשים מרתיעה מדיווח. שאלו איזה מידע, אילו הרשאות ואילו תמריצים גרמו לפעולה להיראות סבירה.

    ״מישהו הפעיל גישה לאינטרנט״ הוא תחילתו של תחקיר. למה שינוי אחד יכול היה לחשוף יעדים אמיתיים? למה בדיקות ההתחלה לא גילו זאת? מי היה אחראי לתגובה אחרי ההתרעה?

    תחקרו גם אירועים שכמעט גרמו לנזק: ניסיון יציאה שנחסם יכול לחשוף הנחה שברירית לפני פריצה. תנו לכל פעולת תיקון אחראי, מועד יעד ובדיקה שמוכיחה שהושלמה. שתפו ממצאים רלוונטיים בין צוותים שמשתמשים באותה תשתית.

    ללא האשמות לא אומר ללא אחריות. תגמלו אנשים שעוצרים עבודה לא בטוחה, והקצו זמן לתיקון המערכת במקום להסתפק בכתיבת הדוח.

    הדיווחים הפומביים אינם מוכיחים שתחקירים ללא האשמות היו חסרים. הם כן חושפים פערים בהקמה, בכיסוי ובתגובה שתחקירים כאלה צריכים לטפל בהם.

    החלטת הפעלה או עצירה, לא סיסמת בטיחות

    לפני ריצה בסיכון גבוה, דרשו ראיות שהיעדים בשליטתכם, שמסלולי הרשת נבדקו, שהניטור מכסה בדיוק את הסביבה הזאת ושמנגנון העצירה עובד גם כשהמודל לא מגיב.

    הגדירו מי יכול לעצור את הריצה, מי מקבל אחריות בהעברת משמרת ומי מאשר הפעלה מחדש. בדיקה קריטית חסרה צריכה לחסום את הריצה, לא להפוך להערה לקראת ההשקה הבאה.

    אפשרו ניסויים מהירים בתוך הגבול הזה. התקדמו בזהירות כשמשנים את הגבול עצמו.

    כאן הדימוי של רובינסון מועיל במיוחד: בטיחות אינה ביטחון שאנשים או מודלים יתנהגו באופן מושלם. היא מערכת בדוקה למקרים שבהם הם לא.

    מקורות

    תמונת פתיחה: מטוס T-38C Talon ובקר תעבורה אווירית בתרגיל פינוי מגדל מדומה, בסיס Laughlin, ‏26 ביוני 2025, מאת Senior Airman Keira Rossman, חיל האוויר האמריקאי. נחלת הכלל כיצירה של הממשל הפדרלי האמריקאי. הוקטנה מ-6048 על 4024 ל-1920 על 1277 פיקסלים, ללא עריכות נוספות. תמונת הארכיון מתרגיל הרציפות ממחישה מוכנות, ולא מעבדת AI או את התקריות שנדונו. אין בה משום הבעת תמיכה.

    שיתוף: