בינה מלאכותית

גוגל דיפמיינד זורקות את מנוע הראייה הנפרד: כך Gemma 4 לומדת "לראות" בלי מתווכים

גוגל דיפמיינד זורקות את מנוע הראייה הנפרד: כך Gemma 4 לומדת "לראות" בלי מתווכים
תקציר

עד היום מודלים רב-מודליים כמו רוב מודלי השפה הגדולים בנו את יכולת הראייה שלהם על גבי "מתרגם" נפרד - אנקודר תמונה שממיר פיקסלים לווקטורים לפני שהמודל...

עד היום מודלים רב-מודליים כמו רוב מודלי השפה הגדולים בנו את יכולת הראייה שלהם על גבי "מתרגם" נפרד - אנקודר תמונה שממיר פיקסלים לווקטורים לפני שהמודל השפתי בכלל נוגע בהם. ב-Gemma 4, הדגם החדש שגוגל דיפמיינד פרסמה בדוח הטכני שלה, המודל עובר לארכיטקטורה ללא אנקודר נפרד (encoder-free), שבה טקסט, תמונה וקול מעובדים יחד באותו מנגנון פנימי - מה שלמעשה משנה את הצורה שבה הבינה המלאכותית "קולטת" את העולם החזותי.

המשפחה כוללת דגמים בגדלים שונים, מ-2.3 מיליארד ועד 31 מיליארד פרמטרים, בגרסאות dense ו-Mixture-of-Experts, וכוללת גם "מצב חשיבה" (thinking mode) שמאפשר למודל לייצר שרשרת נימוקים לפני שהוא עונה - יכולת שעד כה יוחסה בעיקר לדגמי הדגל היקרים יותר. המשמעות המעשית היא דיוק גבוה יותר במשימות שדורשות הבנה משולבת של תמונה וטקסט, תוך צריכת משאבים נמוכה משמעותית, מה שהופך יכולות שהיו שמורות למודלים ענקיים לזמינות גם על חומרה צנועה יותר.

הצעד הזה לא מגיע בוואקום: באותה תקופה דיפמיינד הציגה גם את GenCeption, גישה שמראה שמודל וידאו גנרטיבי בודד יכול לבצע משימות ראייה ממוחשבת כמו הערכת עומק וזיהוי תנועת מצלמה בלי להיות מאומן ספציפית לכל משימה. המגמה הכוללת ברורה: החברה מנסה לבנות "תפיסה" חזותית שנלמדת באופן טבעי מתוך המודל עצמו, ולא מוצמדת אליו כתוסף חיצוני - כיוון שעשוי להשפיע על כל דבר, מרובוטים ועד אפליקציות שמנתחות תמונות בזמן אמת.

שוקי הון עכשיו

S&P 500 ▲ +0.6%
נאסד"ק ▲ +1.3%
ביטקוין ▲ +0.1%
דולר/שקל ▼ 0.6%