בינה מלאכותית

המהפכה שתחסוך ל-DeepSeek מיליוני דולרים באימון AI

תקציר

סרטון מסביר איך DeepSeek מצאו טריק מהירות מטורף שמאיץ אימון מודלי AI בצורה דרמטית. פריצת דרך שיכולה לשנות את כללי המשחק בתעשייה.

סרטון מסביר איך DeepSeek מצאו טריק מהירות מטורף שמאיץ אימון מודלי AI בצורה דרמטית. פריצת דרך שיכולה לשנות את כללי המשחק בתעשייה.

סרטון מסביר איך DeepSeek מצאו טריק מהירות מטורף שמאיץ אימון מודלי AI בצורה דרמטית. פריצת דרך שיכולה לשנות את כללי המשחק בתעשייה.

הטריק המרכזי מאחורי הפריצה הוא מעבר לאימון ב-FP8 - ייצוג מספרי של 8 ביט בלבד במקום ה-16 או 32 ביט המקובלים אצל רוב מפתחות מודלי השפה הגדולים. המעבר ל-FP8 חוסך כמעט מחצית מזיכרון ה-GPU הנדרש לאימון, ומאפשר קבוצות נתונים (batches) גדולות יותר וזרימת נתונים מהירה משמעותית בין השבבים. כדי שהדיוק המספרי הנמוך לא יפגע באיכות המודל, DeepSeek פיתחו שיטת כיול עדין ברמת הבלוקים (block-wise scaling) ושמרו על דיוק גבוה יותר רק ברכיבים הרגישים במיוחד, כמו שכבת ההטמעה, ראש הפלט ומנגנון תשומת הלב.

לצד החדשנות בדיוק המספרי, הצוות בנה גם אלגוריתם תזמון מקביל משלו בשם DualPipe, שמפצל את תהליך האימון בין אלפי מעבדי GPU בצורה שמצמצמת זמני המתנה ומנצלת את החומרה כמעט עד תום. לפי הדוח הטכני שפרסמה החברה, אימון על כל טריליון טוקנים דרש רק כ-180 אלף שעות GPU על אשכול של 2,048 שבבי H800 - כלומר כשלושה ימים וחצי בלבד לכל טריליון טוקנים. בסך הכול הושלם שלב האימון המקדים של הגרסה, שכלל 14.8 טריליון טוקנים, בפחות מחודשיים.

המספר שהכה גלים בכל התעשייה הוא עלות האימון הכוללת: כ-5.5 מיליון דולר בלבד, המבוססים על כ-2.788 מיליון שעות GPU. מדובר בשבריר קטן מהעלויות המוערכות של מודלים מתחרים כמו GPT-4, שהגיעו להערכות של עשרות ומאות מיליוני דולרים לאימון בודד. חשוב לציין שהמספר הזה משקף רק את ריצת האימון הרשמית הסופית, ואינו כולל את עלויות המחקר, הניסויים והכשלים שקדמו לה - אך גם כך, הפער מול השחקניות הגדולות בשוק היה דרמטי מספיק כדי לעורר דיון ציבורי נרחב על יעילות מול גודל תקציב.

ההשפעה על השוק לא איחרה להגיע: מניות ענקיות שבבים וחברות תשתית בינה מלאכותית ספגו ירידות חדות בעקבות החשש שהשקעות ענק בחומרה יתייתרו אם אפשר להגיע לתוצאות דומות בעלות נמוכה בהרבה. מאז, גם מעבדות מובילות אחרות ויצרני חומרה כמו נבידיה החלו לאמץ ולשלב טכניקות דיוק נמוך דומות, כולל גרסאות מתקדמות יותר כמו MXFP8 על שבבי B200 החדשים, שמדווחות על שיפור מהירות אימון של עד 41% נוספים. מה שהיה בתחילה טריק הנדסי ספציפי הופך בהדרגה לסטנדרט תעשייתי חדש.

שוקי הון עכשיו

ת"א 35 ▲ +1.3%
S&P 500 ▲ +0.7%
נאסד"ק ▲ +1.0%
ביטקוין ▼ 0.1%