בינה מלאכותית

מודל קטן מ-27 מיליארד פרמטרים מנצח את קלוד ו-GPT-5.5 — במשחק שהם לא התאמנו עליו

מודל קטן מ-27 מיליארד פרמטרים מנצח את קלוד ו-GPT-5.5 — במשחק שהם לא התאמנו עליו
תקציר

לא עוד באפים על כתיבה או קוד: סטארטאפ בריטי טוען שהסוכן שלו טוב יותר בלשחזר ניסויים מדעיים אמיתיים — התחום שאמור להיות המבחן האמיתי לבינה מלאכותית שתורמת למדע.

📌 תקציר: מעבדת AI בריטית בשם Inherent, שהוקמה על ידי בכירים לשעבר מ-DeepMind, השיקה סוכן בשם Faraday שמצליח לשחזר תוצאות של מאמרים מדעיים טוב יותר מ-Claude Opus 4.8 ומ-GPT-5.5 — למרות שהוא רץ על מודל בסיס קטן משמעותית.

בעולם שבו כל שבוע מכריזים על מודל "הכי חכם אי פעם", קשה למצוא השוואה שבאמת אומרת משהו. סטארטאפ בריטי בשם Inherent, שהוקם על ידי שלושה בכירים לשעבר מ-DeepMind (טנטום קולינס, אדוארד יוז ולואי קירש) לצד קלויאן אלקסייב מ-Reka AI ומיקרוסופט, בחר במבחן דווקא לא סקסי: לא כתיבת שירים, לא פתרון בעיות מתמטיקה תחרותיות, אלא שחזור נאמן של ניסויים מדעיים שכבר פורסמו.

הסוכן שהם בנו, בשם Faraday, מקבל מאמר מדעי בלי לדעת מראש מה התוצאה שלו אמורה להיות, וצריך לשחזר את הממצאים בעצמו — כולל כתיבת קוד, הרצת ניסויים והפקת גרפים תואמים. לפי החברה, במשימות מתחום למידת המכונה שדומות לנתוני האימון שלו, Faraday ניצח את קלוד ב-73% מהמקרים; ובמבחן קשה יותר על מאמרים מתחום ״AI for science״ שהמודל מעולם לא ראה, הוא עדיין הצליח לעקוף את המתחרים ב-60% מהמשימות.

הנקודה שגורמת לסיפור להיות מעניין היא לא רק התוצאה, אלא איך הגיעו אליה. Faraday רץ על מודל בסיס בשם Qwen 3.6, עם 27 מיליארד פרמטרים בלבד — גודל זעיר יחסית מול קלוד Opus 4.8 ו-GPT-5.5, ששניהם מודלים מהשורה הראשונה בממדים גדולים בהרבה. במקום להסתמך על כוח גס, Inherent אימנה את הסוכן באמצעות RL לטווח ארוך (long-horizon reinforcement learning), תוך שימוש בסוכני קוד ככלי עבודה, כדי להקנות לו מה שהחברה מכנה "אינטואיציה מדעית" — לא רק ידע, אלא שיטת עבודה של חוקר זהיר.

זה משמעותי כי שחזור ניסויים הוא בדיוק המקום שבו מודלי שפה נוטים להיכשל בשקט: קל לייצר תשובה שנשמעת סבירה, קשה הרבה יותר לבנות בפועל את הפייפליין הנכון, לדבוק בפרוצדורה המקורית ולקבל תוצאה שבאמת תואמת את מה שפורסם. Inherent טוענת שזו בדיוק המיומנות הבסיסית שצריכה להתקיים לפני שאפשר לדבר ברצינות על AI שמייצר תגליות מדעיות חדשות, לא רק חוזר על קיימות.

מאחורי הסיפור עומד גם כסף לא מבוטל: החברה יצאה מהצללה במאי עם גיוס Seed של 50 מיליון דולר, בהובלה משותפת של Index Ventures ו-Radical Ventures, בהשתתפות קרנות כמו NVentures ו-Ex/Ante. זה ממקם את Inherent בתוך גל גדל והולך של מעבדות שמנסות לבנות לא רק צ'אטבוטים, אלא "מדענים דיגיטליים" — כלי שיעבדו לצד חוקרי אדם ויחסכו את החלק המייגע והאיטי של המדע: שחזור, אימות וניקוי ניסויים לפני שאפשר בכלל להתחיל לחדש.

כמו בכל השוואה שמפרסמת החברה עצמה על עצמה, שווה לקחת את המספרים בערבון מוגבל עד שיבואו בדיקות עצמאיות — אבל אם אכן מדובר במודל קטן שמנצח ענקים במשימה שדורשת דיוק מדעי אמיתי, זה סימן מעניין לכיוון הבא בתעשייה: לא רק "גדול יותר", אלא "מאומן נכון יותר" למשימה ספציפית.

שוקי הון עכשיו

S&P 500 ▲ +0.4%
נאסד"ק ▲ +0.4%
ביטקוין ▲ +0.2%
דולר/שקל ▼ 0.4%