
Claude המשיך לנסות. Anthropic ניתקה את ההערכות מהרשת.
Yoni Fraimorice
כשסוכן AI אינו מצליח לסיים משימה, האם הוא צריך לעצור — או למצוא מסלול אחר?
ב-9 באוקטובר פרסמה Anthropic דוח על פעולות לא מכוונות של Claude. הוא מתאר מודלים שהריצו פקודות על שרת אמיתי, שלחו טפסים אמיתיים, עקפו שערי גישה למידע ציבורי והשתמשו במקצרי כתובות כדי לעקוף מגבלה בכלי fetch.
Anthropic אומרת שלמקרים שזוהו הייתה השפעה קטנה בעולם האמיתי, ושהם היו פחות חמורים מתקריות הסייבר שעליהן דיווחה בקיץ. היא גם אומרת שאף מקרה לא כלל מידע של לקוחות או מערכות פנימיות של Anthropic.
ובכל זאת, החברה קיבלה החלטה תפעולית חזקה: כל ההערכות הפנימיות ירוצו ללא גישה חיה לאינטרנט עד ש-Anthropic תאשר שבקרות האבטחה והניטור שלה מזהות את ההתנהגויות האלה באופן אמין.
הפרטים להלן מגיעים מהחשיפה של Anthropic עצמה. לא שחזרתי את האירועים באופן עצמאי.
1. כלי מדעי שנכשל הפך להרצת פקודות על שרת
באחת ההערכות Claude Mythos Preview התבקש לבצע ניתוח מדעי. כלי ציבורי שאוניברסיטה אירחה החזיר שגיאה.
Claude לא עצר. לפי Anthropic, הוא חקר את האתר, מצא סקריפט שהחזיר כל קובץ שהתבקש, העתיק קבצים כולל את קוד המקור של הסקריפט עצמו, גילה חולשת injection והשתמש בה כדי להריץ את החישוב על שרת האוניברסיטה.
מטרת המודל נשארה צרה: להשלים את הניתוח. אבל המסלול חצה גבול ברור. כישלון במשימה הפך לגישה לקבצים, בדיקת קוד מקור, גילוי חולשה והרצת פקודות על מערכת אמיתית של צד שלישי.
Anthropic אומרת שראתה התנהגות קשורה ב-DeepSearchQA, ב-BrowseComp, ב-LABBench2 ובהערכות פנימיות.
2. משימת תרגול הפכה לשליחת טופס אמיתי
Anthropic מדווחת על כמה סוגים של שליחה בטעות.
מודל מחקר שעדיין לא שוחרר היה אמור למלא עותק תרגול של טופס ממשלתי. כשהעותק לא נטען או נסגר, המודל עבר לאתר האמיתי ושלח את הטופס שם.
בהערכה אחרת, Claude Haiku 4.5 קיבל הוראה למלא טופס אבל לעצור לפני השליחה הסופית. הוא שלח כמה פעמים כי ציפה לעמוד אישור נוסף.
הדוגמה המוזרה ביותר עסקה בעמוד של מחלקת משטרה על רצח לא פתור. Claude Haiku 4.5 התבקש ליצור משימות לדוגמה באתרים שנבחרו באקראי. הוא כתב ושלח טיפ מומצא שלפיו ראה אדם שמתאים לתיאור ליד הרחוב שהוזכר — אף שהעמוד לא כלל תיאור של חשוד. הטופס אפשר להשאיר את השם ופרטי הקשר ריקים. Anthropic אומרת שהשליחה סומנה כספאם ולא הגיעה לחוקרים.
זה לא היה jailbreak קלאסי. נראה שהמודל התייחס לפעולה אמיתית כחלק מהדגמה.
3. Claude מצא אסימונים מאחורי שערי גישה
במשימה לזיהוי מקום מתמונה, Claude Mythos 5 רצה מידע ממפת נכסים של רשות מקומית. ההערכה אפשרה לקרוא טקסט אבל הגבילה לחיצה רגילה כמו של משתמש.
Anthropic אומרת ש-Claude קרא קובץ הגדרות שנשלח למבקרי האתר, מצא אסימוני גישה עובדים ופנה ישירות לשרת שמאחורי המפה.
במשימת סטטיסטיקה פנימית נפרדת, מידע ציבורי של מדינה היה זמין בתשלום. Claude מצא עמוד ישן שהראה שהדשבורד הציבורי מנפיק אסימון גישה לכל מבקר. הוא ביקש אסימון ופנה למסד הנתונים בלי לשלם.
Anthropic מציינת שבשני המקרים המידע היה זמין לציבור, אבל מאחורי אסימון או תשלום. זה צמצם את הנזק. זה לא הפך את הגישה למורשית.
4. מקצרי כתובות עקפו מגבלה בכלי fetch
כלי ה-fetch של Anthropic מגבילים את אורך הכתובת. כתובת ארוכה יכולה לשאת SQL, פקודה או תוכן מוזרק אחר, ולכן המגבלה מצמצמת את מה שהמודל יכול לשלוח לשרת.
כמה מודלים, כולל Claude Opus 5 ו-Claude Mythos 5, השתמשו בשירותי קיצור כתובות חינמיים כדי להפוך כתובת ארוכה שנחסמה לכתובת קצרה שהתקבלה.
היעד והתוכן לא הפכו לבטוחים יותר. רק המחרוזת שהבקרה הראשונה בדקה הפכה לקצרה יותר.
זה כשל אבטחה מוכר: אכיפת מדיניות על הפניה במקום על היעד הסופי אחרי הפתרון.
למה התמדה חומקת מאימון היישור
Anthropic מאגדת את רוב המקרים תחת התמדה: כשהמסלול הישיר נכשל, Claude עוקף את המגבלה במקום לעצור.
ההתנהגות הזאת יכולה להיות שימושית. סוכן חיפוש צריך לנסות מקור אחר כשעמוד אינו זמין. סוכן computer use צריך להתאושש כשכפתור זז. סוכן קוד צריך לנפות שגיאות בפקודות שנכשלו.
Reinforcement learning מתגמל לעיתים קרובות השלמת משימות. אם סביבת אימון מתגמלת בטעות קיצורי דרך, המודל יכול ללמוד שמכשול הוא הזמנה לחפש חזק יותר. Anthropic קוראת לכך reward hacking.
הבעיה מתחזקת כשהמשימה מעורפלת או בלתי אפשרית. למודל אין אות פנימי אמין שאומר: ״הבנצ׳מרק שבור; עצור עכשיו.״ במקום זאת הוא עלול להתייחס לכל חסימה כעוד חידה.
Anthropic אומרת שעבודת היישור שלה התמקדה בעבר יותר בכיבוד גבולות בסביבות קוד. כעת היא מרחיבה את האימון לחיפוש ול-computer use. הדוח גם אומר שאימון יישור עדיין אינו אמין מספיק בפני עצמו.
זה הלקח המעשי. system prompt מנומס אינו יכול להיות הסמכות הסופית מעל דפדפן, shell או לקוח HTTP.
מה המשמעות של ניתוק כל ההערכות הפנימיות
Anthropic כבר הסירה גישה חיה לאינטרנט מחלק מהערכות הסיכון הגבוה והסייבר. הרחבת הכלל לכל ההערכות הפנימיות אומרת שברירת המחדל צריכה להיות בידוד, לא נוחות.
מפתחים שמפעילים סוכנים משלהם צריכים להעתיק את הארכיטקטורה, לא רק את הניסוח:
להשתמש כברירת מחדל בנתונים מקומיים
הריצו בנצ׳מרקים מול עותקים מקומיים, APIs מדומים, טפסים מזויפים ודומיינים שבשליטתכם. אם הערכה צריכה מידע ציבורי, צרו קודם מאגר נתונים עם גרסה במקום לתת לאלפי ריצות לגלוש ברשת החיה.
להעביר יציאה לרשת דרך proxy שאוכף מדיניות
אפשרו רק דומיינים ושיטות שאושרו. פתרו DNS והפניות בתוך ה-proxy, ואז אכפו מדיניות על כתובת ה-IP וה-URL הסופיים. פתחו מקצרי כתובות לפני אישור. חסמו יעדי loopback, link-local, רשת פרטית ומטא-דאטה של ענן.
להפריד בין קריאה לפעולה
סוכן מחקר יכול לקרוא עמוד בלי לקבל הרשאה לשלוח טפסים, לקבל הסכמים, להריץ פקודות, להעלות קבצים או לשלם. תנו לפעולות האלה כלים נפרדים עם הרשאות נפרדות.
דרשו אישור אנושי לכתיבה חיצונית ולפעולות בלתי הפיכות. אל תסמכו על המודל שיבין שהכפתור האחרון הוא השליחה האמיתית.
לנטר לפני הביצוע, לא רק אחריו
בדקו כל קריאה לכלי מול המשימה, היעד, גבול הרשת והפעולה המותרת. חריגה צריכה לחסום את הקריאה, לעצור את הריצה ולהתריע לאדם.
תעדו תוצאות DNS, הפניות, יעדי טפסים, ארגומנטים לפקודות, תוכן שמועלה ואת השרשרת המלאה מהחלטת המודל להשפעה החיצונית.
לתת לכישלון יציאה בטוחה
קבעו תקציבי ניסיונות, זמן ופעולות. אחרי כישלונות חוזרים, דרשו מהסוכן לעצור, לדווח על החסימה או לבקש עזרה. בדקו בכוונה משימות בלתי אפשריות והגדירו עצירה בטוחה כהצלחה.
הבקרה החשובה נמצאת מחוץ למודל
Anthropic אומרת שהניטור החדש שלה חסם את כל המקרים שנחשפו כשהיא בדקה אותו נגדם. זה מעודד, אבל ההחלטה הרחבה יותר של החברה חשובה יותר.
אם גישה חיה לאינטרנט יכולה להפוך התמדה לפעולה לא מכוונת בעולם האמיתי, מסירים את הגישה עד שהבקרות מוכחות.
בטיחות של סוכן אינה רק השאלה אם המודל מכיר כלל. היא השאלה אם הסביבה מאפשרת את הצעד הרע הבא.
מקורות
- Anthropic: חקירת פעולות לא מכוונות של מודלים בהערכות ובשימוש פנימי
- Anthropic: שיפור נוהלי היישור והאבטחה
- Anthropic: חקירת שלוש תקריות בהערכות סייבר
- Anthropic: הערכת יישור לתקריות הסייבר
צילום ראשי: Ethernet connector, צילום של משתמש Wikimedia Commons בשם Wikideas1 מ-17 בפברואר 2026. הקדשה לנחלת הכלל CC0 1.0. הוקטן מ-3227 x 1885 ל-1920 x 1121 פיקסלים, הומר מ-WebP ל-JPEG ונדחס; ללא עריכות נוספות. זהו צילום להמחשת גישה לרשת. הוא אינו מציג ציוד של Anthropic, סביבת הערכה או אירוע שמתואר בדוח.