בזמן שכולם מחכים לשבבים חדשים, חברה בת 11 אנשים אומרת שאפשר לדחוס פי 30 יותר מהירות מתוך אותם GPU קיימים — רק עם קוד טוב יותר.
יש נרטיב שכולם בתעשיית ה-AI כבר קנו: GPU נבנו בשביל אימון מודלים, לא בשביל השיחה המהירה והאינטראקטיבית שסוכני AI צריכים. המסקנה המתבקשת הייתה שצריך חומרה חדשה — שבבי אינפרנס ייעודיים, ארכיטקטורות חדשות, עוד כסף, עוד המתנה. הסטארטאפ הצרפתי Kog בא ואומר: זו לא בעיית חומרה. זו בעיית תוכנה שאף אחד לא טרח לפתור כמו שצריך.
החברה, שיצאה מהצללים במאי 2025 ומונה כ-11 עובדים בלבד, בנתה מנוע אינפרנס שיורד עמוק לרמת החומרה עצמה — כתיבת קוד ברמה נמוכה מאוד עבור ה-GPU, במקום להסתמך על שכבות התוכנה הגנריות שרוב התעשייה משתמשת בהן. התוצאה, לפי Kog: עד פי 30 שיפור במהירות האינפרנס על אותם GPU קיימים, בלי צורך בחומרה חדשה. בדמו שהחברה הריצה על שרת יחיד עם שמונה GPU מסוג AMD Instinct MI300X, היא הציגה קצב של יותר מ-3,000 טוקנים בשנייה עבור בקשה בודדת של משתמש אחד — מספר שרחוק מאוד ממה שרוב מנועי ה-inference הסטנדרטיים מספקים היום.
ההבדל בין אינפרנס "רגיל" לאינפרנס שמתאים לסוכני AI הוא לא רק כמה טוקנים בשנייה יוצאים בממוצע, אלא כמה מהר מגיעה התשובה הראשונה וכמה יציב הקצב לאורך שיחה ארוכה עם הרבה קריאות חוזרות — בדיוק מה שסוכן שמריץ שרשרת של פעולות (לחפש, לקרוא, להחליט, לפעול) צריך. אם כל שלב בשרשרת גורר השהיה, הסוכן כולו מרגיש איטי, גם אם כל שלב בפני עצמו נשמע מהיר. Kog טוענת שהיא בדיוק שם פתרה את הבעיה: לא רק תפוקה גולמית, אלא זמן תגובה בזמן אמת שמתאים לשימוש אינטראקטיבי.
מבחינה עסקית, Kog לא מסתפקת בהוכחת קונספט במעבדה. החברה מדווחת על מעל 200 לידים עסקיים שכבר פנו אליה, מה שמרמז על ביקוש אמיתי מצד חברות שמרגישות בכיס כמה עולה כל שנייה של המתנה לתשובת AI. היא גם מגובה על ידי הזרוע הממשלתית הצרפתית Bpifrance ותוכנית French Tech 2030, ועובדת בשיתוף פעולה עם ספק הענן הצרפתי Scaleway ועם AMD עצמה — לא שחקן שוליים אלא כזה שכבר מקבל אישור מיצרן השבבים על התוצאות.
הפואנטה הכלכלית כאן חדה: כל תעשיית ה-AI רצה כרגע אחרי עוד שבבים, עוד מרכזי נתונים, עוד השקעות ענק בתשתית — ג'נסן וואנג ו-Nvidia לא צריכים הצגה. אם חברה קטנה מפריז יכולה להראות שיפור פי כמה וכמה מתוך GPU שכבר קיימים ברכוש של חברות ענן, זו לא רק בשורה טכנית אלא גם כלכלית: פחות תלות בחומרה חדשה, פחות המתנה לתורים על שבבים, ופוטנציאל לחסוך הון עתק בלי לקנות אף שרת נוסף.
השאלה הפתוחה היא כמובן אם ה-30x הזה שורד מעבר לדמו מבוקר לתנאי ייצור אמיתיים, עם עומסים משתנים ומודלים שונים. אבל אם רק חלק מהטענה מחזיק מים, זו תזכורת נחמדה שלפעמים הפתרון לא נמצא בקנייה של עוד חומרה — הוא נמצא בלכתוב קוד טוב יותר למה שכבר יש לך.