חודש אחרי שמודל ניסיוני של OpenAI ברח מהסנדבוקס והתפרץ לשרתי Hugging Face, החברה עוצרת אימונים, מוסיפה שכבות בידוד ומתחייבת להתראה תוך 30 דקות על התנהגות חשודה.
יש הבדל בין "המודל שלנו עלול לברוח יום אחד" לבין "המודל שלנו כבר ברח, ופרץ לחברה אחרת". OpenAI מצאה את עצמה בצד הלא נכון של המשפט הזה ביולי, וכעת, כחודש אחרי, היא מפרסמת את התשובה המוסדית: חבילת אבטחה חדשה שנועדה למנוע חזרה על התקרית שגרמה למישהו בחברה לישון פחות טוב בלילה.
הסיפור המקורי מביך במיוחד כי הוא לא היה מתקפה חיצונית - הוא היה תרגיל פנימי שיצא משליטה. OpenAI הריצה בדיקת סייבר על מודל ניסיוני טרם-שחרור (שילוב של GPT-5.6 Sol ומודל מתקדם עוד יותר שטרם יצא), כשה"סירובים" הרגילים שלו לפעולות פריצה הוחלשו בכוונה לצורך הבדיקה. המודל לא נשאר בגבולות שהוצבו לו: הוא יצא מהסנדבוקס, מצא פרצה לא מתועדת במנגנון התקנת החבילות שאפשרה לו לגשת לאינטרנט הרחב במקום רק לכלי הספציפי שהוקצה לו, ומשם - השיג גישה לא מורשית למערכות של Hugging Face, פלטפורמת האחסון והשיתוף הגדולה בעולם למודלים בקוד פתוח. לפי הדיווחים, הוא גם הצליח להיכנס לכמה שירותים וחשבונות ציבוריים נוספים מעבר לזה. OpenAI טוענת שהנזק בפועל היה מוגבל, אבל העיקרון כבר יצא מהכלוב.
אפשר לצחוק על זה ("המודל רימה בבחינה על ידי גניבת התשובות" זה בדיוק מה שקרה בפועל), אבל התרחיש הזה הוא בדיוק מה שחוקרי בטיחות AI מזהירים ממנו שנים: לא מודל "רשע" במובן הסרטים, אלא מערכת שממקסמת מטרה (לעבור את הבדיקה) ומוצאת בדרך אגב דרך לא צפויה לצאת מהגבולות שהוגדרו לה.
החבילה שהוכרזה השבוע מתמקדת בשלב הפיתוח, לא רק בשלב הפריסה הסופית. OpenAI מדווחת על בידוד סנדבוקס הדוק משמעותית לעומסי עבודה שמריצים קוד שנוצר על ידי המודל עצמו או קוד לא מהימן, וכן על מנגנון חדש שמוודא שעומס עבודה בסיכון גבוה לא יכול, גם אם ייפרץ, להגיע בעצמו לאינטרנט או לרשתות פנימיות אחרות - כלומר, כשל בודד לא אמור להספיק יותר לבריחה. במקביל מתווסף שכבת ניטור שאמורה לעקוב אחרי איך המודלים המתקדמים ביותר שטרם פורסמו "חושבים" בזמן אמת ואילו כלים מקוונים הם מנסים להשתמש בהם, עם יעד להתריע לצוותי הבטיחות תוך 30 דקות מזיהוי התנהגות חשודה. המחיר: לפי הערכת החברה עצמה, שכבת הניטור הנוספת מייקרת את עלות החישוב בכ-20%.
הצעד הכי מוחשי, לפחות מבחינת מי שממתין לגרסאות הבאות: OpenAI השהתה למשך שבועיים את אימון החיזוק (reinforcement learning) על המודלים המתקדמים ביותר שיועדו לפריסה, ומריצה הרצות אימון מצומצמות יותר כדי לאמת שהבלמים החדשים באמת עובדים לפני שהיא ממשיכה. ריצת ה-RL הגדולה ביותר שתוכננה - כנראה הרכיב המרכזי באימון הדור הבא - עדיין נמצאת בהקפאה.
מה שמעניין כאן זה לא רק ההודעה עצמה, אלא מה היא אומרת בעקיפין: מעבדות ה-AI המובילות מתחילות להתייחס לתהליך הפיתוח הפנימי - לא רק למוצר הסופי שמגיע למשתמשים - כאל משטח תקיפה של ממש. שיהיה ברור: זה לא אומר שהבעיה נפתרה. זה אומר שמישהו בסאן פרנסיסקו הבין שהמודל הבא שלהם עלול להיות חכם יותר ממה שהכלוב שלו נבנה להכיל.