אנתרופיק השיקה את Claude Opus 4.8, גרסה שהחברה עצמה מתארת כשיפור "צנוע אך מוחשי" - אבל הנתון שבלט בבדיקות החיצוניות הוא לא ביצועי קידוד או הבנת שפה...
אנתרופיק השיקה את Claude Opus 4.8, גרסה שהחברה עצמה מתארת כשיפור "צנוע אך מוחשי" - אבל הנתון שבלט בבדיקות החיצוניות הוא לא ביצועי קידוד או הבנת שפה, אלא שיעור הטעויות העובדתיות. מתוך שישה מודלים שנבדקו באותם מבחני אמינות, לאופוס 4.8 היה שיעור התשובות השגויות הנמוך ביותר בכל אחד מהמבחנים - כלומר פחות הזיות (hallucinations), התופעה שבה מודל שפה "ממציא" עובדות בביטחון מלא.
מה שמעניין בשיטה: המודל לא הגיע לתוצאה הזאת כי הוא פתאום יודע יותר. הוא הגיע אליה כי הוא נמנע מלענות כשהוא לא בטוח, במקום לנחש. זה שינוי גישה בסיסי באימון - להעדיף "אני לא יודע" על פני תשובה שמצטלצלת משכנעת אבל שגויה. אנתרופיק קוראת לזה שיפור ב"honesty", ומדגישה שהמודל גם שקוף יותר כשהוא נתקל באי-ודאות, זקוק להבהרה, או מזהה שהגישה שהוא נוקט בה כנראה לא אופטימלית לבעיה שהוצגה לו.
לשוק הישראלי זה לא עניין אקדמי: ככל שיותר חברות משלבות מודלי שפה בכלי עבודה, קוד וקבלת החלטות, שיעור ההזיות הוא בדיוק הפרמטר שקובע כמה אפשר לסמוך על הפלט בלי לבדוק אותו ידנית. מודל שמודה בבורות שלו במקום להמציא - גם אם זה בא על חשבון "תשובה לכל שאלה" - הוא בפועל כלי עבודה אמין יותר, ולא רק אטרקציה שיווקית.
הנתונים המדויקים ממחישים את גודל השינוי: במבחן AA-Omniscience, שבודק ידע רחב לצד יכולת להימנע מתשובה שגויה, לאופוס 4.8 שיעור הזיות של 35.9% ורמת דיוק של 46.6%, מה שמעניק לו מדד "Omniscience" של 27 - השני בגובהו מבין כל המודלים המובילים בשוק, מיד אחרי Gemini 3.1 Pro. זה לא אומר שהמודל "יודע יותר" מהמתחרים, אלא שהוא מזהה טוב יותר את הגבול שבין מה שהוא באמת יודע לבין מה שהוא רק מנחש.
אנתרופיק מדווחת גם על שיפור בצד ההתנהגותי, לא רק העובדתי. ציון ה"התנהגות לא מיושרת" של המודל ירד מכ-2.5 לכ-1.8 בסולם 1 עד 10, ולפי החברה אופוס 4.8 פחות סביר פי ארבעה מקודמו, אופוס 4.7, להתעלם משגיאות בקוד ולתת להן לעבור בשתיקה. במילים אחרות - המודל לא רק נמנע מהמצאת עובדות, הוא גם פחות נוטה "לעצום עין" כשמשהו בעבודה שהוא בודק נראה שגוי, תכונה קריטית לכל מי שמשתמש בו לסקירת קוד או מסמכים.
תחום אחד שבו השיפור בולט במיוחד הוא עבודה משפטית-אג'נטית: באנתרופיק Legal Agent Benchmark, אופוס 4.8 רשם את הציון הגבוה ביותר שנמדד אי פעם, והוא המודל הראשון שחוצה סף של 10% בסטנדרט ה"all-pass" המחמיר - כלומר השלמת שרשרת משימות משפטיות שלמה בלי אף טעות אחת בדרך. מדובר בתחום שבו הזיה בודדת - ציטוט תקדים שלא קיים, למשל - יכולה להיות יקרה הרבה יותר מאשר בשיחת צ'אט רגילה, ולכן דווקא שם השיפור באמינות מקבל משקל מעשי גבוה.
מאחורי השיפור עומדת שיטת אימון שאנתרופיק מפעילה כבר כמה דורות: החברה בוחנת את קלוד באלפי שאלות מלכודת - עובדות נדושות, נושאי שוליים, שאלות שהתשובה הנכונה היחידה להן היא "אני לא יודע" - ובודקת עד כמה המודל מזהה נכון את חוסר הוודאות שלו במקום למלא את הפער בתשובה משכנעת. זו למעשה התמודדות ישירה עם מתח מובנה באימון מודלי שפה: הדחיפה להיות "מועיל" ולענות על הכל, מול הדחיפה להיות כן לגבי גבולות הידע. ככל שיותר ארגונים - כולל בישראל - מטמיעים סוכני AI במשימות עם השלכות ממשיות, הנכונות של מודל להודות ב"אני לא בטוח" הופכת מתכונת נחמד-שיהיה לדרישת סף.