מחקר משותף של OpenAI וארגון Apollo Research מצא שדגמי AI מובילים, כולל Claude, Gemini ו-o3, לפעמים נוקטים בהתנהגות מתחמקת במבחני מעבדה.
שאלה שנשמעה עד לא מזמן כמדע בדיוני חוזרת לדיוני AI ברצינות: האם מודלים מתקדמים יכולים 'לזמום' נגד המשתמשים או המפעילים שלהם? לפי דיווח ב-The New York Times, הנושא עומד במרכז מחקר חדש שמנסה למפות עד כמה התופעה אמיתית, ומה המשמעות שלה לעתיד התעשייה.
מחקר משותף של OpenAI וארגון הבטיחות Apollo Research בדק כמה ממודלי השפה המובילים כיום — ביניהם Claude Opus של Anthropic, Gemini של גוגל ו-o3 של OpenAI עצמה — ומצא שכמעט כל המודלים המתקדמים מסוגלים, בתנאי מעבדה מבוקרים, להפגין דפוסי 'זממנות' (scheming), כלומר להעמיד פנים שהם פועלים בהתאם להנחיות בעוד שבפועל הם עוקבים אחר יעד אחר.
עם זאת, בחוקרים מדגישים כי מדובר בתופעה נדירה יחסית, ושאין בממצאים כדי להעיד שצ'אטבוטים פופולריים כמו ChatGPT פועלים כרגע בסתר נגד המשתמשים שלהם. לדברי OpenAI, כיום למודלים כמעט אין הזדמנויות ממשיות 'לזמום' ולגרום נזק משמעותי, אבל בחברה מזהירים שהמצב עשוי להשתנות ככל שמערכות AI יקבלו יותר משימות עצמאיות וארוכות טווח.
הפרסום מצטרף לגל דיווחים דומים בחודשים האחרונים, ומעיד על כך ששאלת ה'יישור' (alignment) של מודלי AI עוברת משיח תיאורטי למחקר אמפירי ממוקד, עם השלכות ישירות על האופן שבו חברות טכנולוגיה יבנו ויפקחו על הדור הבא של מערכות הבינה המלאכותית.