בינה מלאכותית

הפער של מיליארד הדולר נסגר: המודל הפתוח שרץ על מחשב ביתי — ומנצח את Opus

הפער של מיליארד הדולר נסגר: המודל הפתוח שרץ על מחשב ביתי — ומנצח את Opus
תקציר

בסוף אוגוסט 2026 שחררה קבוצת Qwen של עליבאבא את Qwen3.8-Flash-Next, מודל במשקולות פתוחות שמוצג כתצוגה מקדימה של ארכיטקטורת Qwen4 הבאה. מבחינת מספרים...

בסוף אוגוסט 2026 שחררה קבוצת Qwen של עליבאבא את Qwen3.8-Flash-Next, מודל במשקולות פתוחות שמוצג כתצוגה מקדימה של ארכיטקטורת Qwen4 הבאה. מבחינת מספרים זה מודל Mixture-of-Experts דליל במיוחד: 125 מיליארד פרמטרים (ועוד טבלת embedding של 51 מיליארד), אבל רק כ-6 מיליארד פרמטרים פעילים לכל טוקן. שלוש מכל ארבע שכבות משתמשות ב-Gated DeltaNet כדי לדחוס היסטוריה, והרביעית מפעילה Qwen Sparse Attention לשליפה מדויקת בטווח ארוך — מה שמאפשר חלון הקשר של 262 אלף טוקנים בגרסה הפתוחה בלי לשלם את מחיר הזיכרון הרגיל של attention מלא.

הסיבה שהשחרור הזה קיבל כותרות היא הבנצ'מרקים. לפי המדידות שפורסמו, המודל רושם 62.5 ב-SWE-bench Pro מול 53.4 של Claude Opus 4.6 Max, ו-81.0 מול 77.5 ב-SWE-bench Multilingual, לצד 91.7 ב-GPQA Diamond. צריך לקרוא את זה בזהירות — חלק גדול מהמספרים מגיע מהיצרן עצמו, ובלוחות דירוג רחבים ועצמאיים יותר המודל יושב באמצע החבילה ולא בראשה. ובכל זאת, גם קריאה שמרנית מובילה למסקנה אחת: מודל שמפעיל 6 מיליארד פרמטרים לטוקן משחק היום באותה ליגה עם מודלים סגורים שעלו מאות מיליוני דולרים לאימון.

מה שהופך את זה לרלוונטי מעשית למפתחים בישראל הוא איפה המודל רץ ובכמה. קהילת ההרצה המקומית מדווחת על הפעלה תקינה על חומרה בהישג יד — RTX 3090 עם 96–128GB DDR5, Mac Studio עם 128GB, או Strix Halo — עם כ-55 עד 61 טוקנים לשנייה בקוונטיזציית INT4 על מערך 3090 עם vLLM. במקביל, ה-API המתארח מתומחר בסביבות 0.16 דולר למיליון טוקני קלט ו-0.47 למיליון פלט, לעומת תעריפים של 5 ו-25 דולר במודלים הסגורים בקצה העליון. עבור סטארט-אפ שמריץ עומסי agent כבדים, זה הפרש של פי עשרות בחשבון החודשי.

שתי הסתייגויות שחשוב לשים לב אליהן לפני שמתכננים מוצר סביב זה. ראשית, המשקולות משוחררות תחת Qwen Community License 1.0 ולא תחת Apache 2.0 — שימוש מסחרי ופיין-טיונינג מותרים, אבל יש דרישות ייחוס מעל סף של 100 מיליון משתמשים חודשיים או 20 מיליון דולר הכנסה חודשית, ורישיון נפרד נדרש למי שבונה שירות מודל-כשירות או עוזר קוד מסחרי. שנית, הגרסה הפתוחה אינה זהה למוצר המתארח: Qwen3.8-Flash בענן מגיע עם חלון הקשר של מיליון טוקנים וכלים מובנים שאינם חלק מהצ'קפוינט שמורידים מ-Hugging Face. עבור ארגונים ישראליים בתחומי בריאות, ביטחון ופיננסים, היכולת להריץ מודל בעוצמה כזו על שרת פנימי — בלי שאף בייט של דאטה יוצא החוצה — היא בדיוק הפער שהתחיל להיסגר כאן.

שוקי הון עכשיו

ת"א 35 ▲ +0.5%
S&P 500 ▼ 0.4%
נאסד"ק ▼ 0.3%
ביטקוין ▼ 1.2%