סטארטאפ הודי מפתח מודל קול המדבר בזמן אמת ממש כמו בן אדם - ומגייס הון להאצת הפיתוח.
🔗 קישור למוצר: Smallest.ai
סטארטאפ הבינה המלאכותית ההודי Smallest.ai הכריז על גיוס סבב Series A בהיקף 13 מיליון דולר, בהובלת Seligman Ventures ובהשתתפות Sierra Ventures ו-3one4 Capital. הגיוס החדש מביא את סך ההון שגייסה החברה עד כה למעל 21 מיליון דולר. המטרה המוצהרת של החברה שאפתנית במיוחד: לבנות מודל קול שיעבור את מבחן טיורינג בשיחות טלפון - כלומר שבני אדם בצד השני של הקו לא יצליחו להבחין אם הם מדברים עם מכונה או עם אדם.
הבידול הטכנולוגי המרכזי של Smallest.ai נוגע לאופן שבו המודל שלה מעבד שיחה. בעוד רוב מודלי השפה הגדולים הנפוצים היום קולטים את כל מה שנאמר להם, מעבדים אותו במלואו ורק אז מייצרים תשובה - מה שיוצר עיכוב מורגש שממש "מסגיר" שיחה עם רובוט - המודל של Smallest.ai מתוכנן להקשיב, לחשוב ולדבר בו-זמנית, כמעט כמו בן אדם, וכך למחוק כמעט לגמרי את פער התגובה שמייצר שיחות מכניות ולא טבעיות. בפועל זה אמור לפתור אחת הבעיות הכי מעצבנות בשיחות עם בוטים קוליים: אותה שתיקה קצרה ומביכה לפני שהבוט "מבין" שסיימת לדבר.
החברה, שהוקמה בהודו, ממקדת את עצמה בשוק צר יחסית אבל עם ביקוש עסקי גבוה: סוכני קול לשירות לקוחות ומכירות בזמן אמת עבור לקוחות ארגוניים. זה שונה מכיוונים שבהם נוקטות חברות מתחרות בתחום הקול הסינתטי, שמתמקדות בעיקר בדיבוב אודיו, פודקאסטים או יצירת קול לתוכן מוקלט מראש. בעוד מתחרות רבות בתחום מתמקדות בייצור קול לתוכן מוקלט, Smallest.ai בחרה להתמקד אך ורק בשיחות קוליות חיות ואינטראקטיביות, תחום שבו כל מילישנייה של עיכוב מורגשת מיד על ידי המשתמש.
לאחרונה חשפה החברה מודל דיבור-לדיבור אסינכרוני חדש בשם Hydra, המבוסס על הארכיטקטורה המתקדמת ביותר שלה - Voice 4.0. המודל תוכנן כדי להפוך שיחות בינה מלאכותית לטבעיות, מגיבות ומדרגיות יותר עבור סביבות ארגוניות בהיקף גדול, כלומר כאלה שצריכות לתמוך באלפי שיחות מקבילות בלי לפגוע באיכות או במהירות התגובה.
הגיוס של Smallest.ai מצטרף לגל השקעות רחב יותר בתחום סוכני הקול המבוססי בינה מלאכותית, תחום שצומח במקביל להתפוצצות סוכני AI לשירות לקוחות ומכירות. ככל שיותר חברות מטמיעות בוטים קוליים בקווי שירות הלקוחות שלהן, כך גדל הלחץ להפוך את השיחות הללו לטבעיות עד כדי כך שהלקוח בכלל לא ישים לב שהוא מדבר עם מכונה - מגמה שמעוררת גם שאלות אתיות לגבי גילוי נאות ושקיפות כלפי הצרכן.
בזירת סוכני הקול הגלובלית, Smallest.ai מתמודדת ישירות מול שחקנית מבוססת יותר בשם Cartesia, שמזוהה עם זמן תגובה ראשוני (Time-to-First-Audio) של כ-40 עד 90 מילישניות בזכות ארכיטקטורת State Space Model ייעודית. ההשוואה בין השתיים ממחישה שיש כיום בשוק שני מסלולי תחרות שונים לגמרי: מירוץ טהור אחר המהירות מול ניסיון לשלב מהירות גבוהה עם איכות קול טבעית יותר ותאימות רגולטורית לארגונים גדולים. Smallest.ai בחרה להתמקם במסלול השני, מתוך הבנה שבסביבות ארגוניות רגישות - בנקאות, ביטוח, שירותי בריאות - לא מספיק לדבר מהר, צריך גם לדבר נכון.
הפלטפורמה שהוצגה תחת השם Voice 4.0 לא מסתכמת רק במודל הדיבור-לדיבור Hydra, אלא כוללת גם רכיב זיהוי דיבור בשם Pulse STT Pro, התומך ב-38 שפות ומשלב תמלול בזמן אמת עם יכולות מתקדמות כמו זיהוי דובר (diarization), זיהוי רגשות בקול, מעבר חופשי בין שפות בתוך אותה שיחה (code-switching), סינון רעשי רקע, וגם מנגנון אוטומטי לזיהוי והשחרה של פרטי תשלום ומידע מזוהה אישית. הכללת יכולות רדקציה של PCI ו-PII כבר ברמת התשתית, ולא כתוספת חיצונית, מרמזת שהחברה בונה את המוצר מראש בהתאם לדרישות ציות שמאפיינות לקוחות פיננסיים וביטוחיים - לא רק סטארטאפים קטנים.
מבחינת פריסה בשוק, Smallest.ai מכוונת את עצמה כעת לא רק לחברות טכנולוגיה אלא גם לענף מיקור החוץ העסקי (BPO) ולמוקדי שירות לקוחות גדולים, תחום שבו כוח אדם אנושי יקר ותורן, ותחלופת עובדים גבוהה הופכת אוטומציה קולית לאטרקטיבית כלכלית במיוחד. המעבר מהתמקדות בסטארטאפים לחתירה אל ענקיות מיקור החוץ והפיננסים מסמן שהחברה רואה בטכנולוגיית זמן-אמת שלה יתרון תחרותי שמצדיק מכירה לארגונים שמריצים מיליוני שיחות בחודש, לא רק פיילוטים קטנים.
מבט רחב יותר על הענף מראה שגיוסי הון בתחום סוכני הקול הקוליים ה"א-סינכרוניים" ו"בזמן אמת" מתרבים במקביל להאצה הכללית בהשקעות על תשתיות AI לשירות לקוחות ומכירות, כאשר משקיעים מהמרים שהיכולת לדחוס עיכוב שיחה למינימום היא חסם הכניסה האמיתי בתחום - לא רק איכות הקול עצמה. ככל שהפער בין שיחה עם מכונה לשיחה עם אדם ימשיך להצטמצם, כך גם יתחדד הצורך הרגולטורי לחייב חברות לגלות בפתיחת השיחה שהצד השני הוא בינה מלאכותית, נושא שעדיין נתון להסדרה שונה ממדינה למדינה.