אותו מודל בדיוק קפץ מ-30% הצלחה ל-100% — רק כי שינו את מה שעוטף אותו, לא את מה שבתוכו.
בשבועות האחרונים המרוץ בתעשיית ה-AI התנהל סביב שאלה אחת: איזה מודל הכי חכם. Nvidia הגיעה עם תשובה שמערערת את כל השאלה. בבדיקה על ARC-AGI-3, מבחן קשה במיוחד שמודד יכולת היגיון לאורך משימות אינטראקטיביות וממושכות, המודל Claude Opus 5 של Anthropic — הטוב ביותר שנבדק — הגיע לבדו ל-30% הצלחה בלבד. לא נורא, זו הייתה התוצאה המובילה. אבל אז Nvidia עטפה את אותו מודל בדיוק בארכיטקטורה משלה בשם AVO, ובלי לגעת במודל עצמו, הציון קפץ ל-100%.
AVO היא לא מודל AI מתחרה, אלא מה שבתעשייה קוראים לו "רתמה" (harness) — השכבה שמסביב למודל: איך הוא זוכר מה כבר ניסה, איך הוא מתאושש מכישלון, ומתי מישהו עוצר אותו לפני שהוא ממשיך לטעות. הפתרון של Nvidia כולל זיכרון מתמשך שנשמר לאורך כל המשימה, ולולאת ביצוע עצמאית שמנהלת את הצעדים של הסוכן. החידוש המרכזי הוא סוכן "מפקח" נפרד, שכל תפקידו לעקוב אחרי הסוכן הראשי ולזהות מתי הוא נתקע במבוי סתום או חוזר בלולאה על מסלול שכבר ניסה ונכשל בו — בדיוק הרגע שבו סוכני AI נוטים "לצאת מהפסים".
המשמעות היא שהפער בין 30% ל-100% לא נבע מיכולת חשיבה נוספת של המודל, אלא מניהול טוב יותר של התהליך סביבו. זה תואם ממצא נוסף שפרסמה Nvidia לאחרונה, לפיו מודלים קטנים שעברו כיוונון עדין (fine-tuning) על עשרות אלפי דוגמאות איכותיות מצליחים להשתוות למודלים ענקיים במשימות ממוקדות — ובבדיקות על מסגרות סוכנים כמו MetaGPT ו-Open Operator נמצא שבין 40% ל-70% מהקריאות שהיו מיועדות למודלים גדולים אפשר להעביר בלי בעיה למודלים קטנים בהרבה.
לחברות שמפתחות סוכני AI המסקנה מעשית לגמרי: תקציב ה-GPU לא חייב לזרום כולו למודל הכי גדול והכי יקר בשוק. השקעה בתשתית שמנהלת זיכרון, מזהה כשלים ומפקחת על הסוכן יכולה להניב שיפור דרמטי בביצועים בעלות נמוכה משמעותית מקפיצה למודל היקר הבא. זו גם סטירת לחי עדינה לנרטיב שליווה את התעשייה כל השנה — שהדרך היחידה קדימה היא מודלים גדולים יותר. Nvidia, שמוכרת את השבבים שמריצים את המודלים האלה, דווקא מרוויחה משני העולמות: גם ממכירת חומרה למודלים ענקיים, וגם מהוכחה שהתשתית שסביבם היא זו שבאמת קובעת.
השאלה הפתוחה היא כמה מהתוצאה הזאת ספציפית ל-ARC-AGI-3, ועד כמה היא תשתכפל במשימות עסקיות אמיתיות מחוץ למעבדה. בינתיים, מי שבונה סוכני AI כדאי שיפסיק לשאול רק "איזה מודל" ויתחיל לשאול גם "איזו רתמה" — כי לפי Nvidia, זו בדיוק השאלה שהוזנחה.