דלג לתוכן הראשי
    מטא מציגה מודל תמלול בזמן אמת המזהה יותר מ-20 דוברים ושפות במקביל
    טכנולוגיה

    מטא מציגה מודל תמלול בזמן אמת המזהה יותר מ-20 דוברים ושפות במקביל

    מערכת YZ Newsיום רביעי, 2 בספטמבר 2026

    המודל החדש, Muse Voice Transcribe, מסוגל לטפל ביותר מ-20 דוברים במקביל ולזהות מעברים בין שפות באמצע משפט. הוא משולב כעת באפליקציית שולחן העבודה וזמין למפתחים

    מעבדת הבינה המלאכותית של מטא (Meta Superintelligence Lab) חשפה מודל קולי חדש בזמן אמת בשם Muse Voice Transcribe, המציג יכולות תמלול ופענוח קולי מתקדמות. המודל מסוגל לזהות ולהבדיל בין יותר מ-20 דוברים שונים במקביל, ולטפל באופן חלק במספר שפות בו-זמנית, כולל מעברים מהירים בין שפות שונות במהלך אותו משפט.

    ההכרזה על המודל מציגה את מודל תפיסת השמע הראשון בזמן אמת של המעבדה, ומציבה אותו כפתרון מתקדם בתחום המרת דיבור לטקסט בהזרמה (Streaming Speech-to-Text). המערכת כוללת יכולות מובנות של הפרדת דוברים (Speaker Diarization) וזיהוי נקודות סיום של קטעי דיבור (Endpointing) בתוך מודל יחיד ואחוד.

    מנגנון שיהוי מסתגל והתמודדות עם הקלטות מורכבות

    אחד המאפיינים המרכזיים של Muse Voice Transcribe הוא מנגנון שיהוי מסתגל (Adaptive Delay). טכנולוגיה זו מאפשרת למודל לקבוע מתי נכון להקשיב ומתי להמתין מעט לפני השלמת ניתוח המילה, על מנת לשפר את הדיוק הכולל של התמלול.

    מנכ"ל מטא, מרק צוקרברג, שיתף בחשבון ה-X שלו סרטון המדגים את יכולת המודל לטפל בריבוי דוברים ובריבוי שפות בו-זמנית. צוקרברג, שחזר לאחרונה לפעילות בפלטפורמה לאחר שלוש שנים שבהן לא פרסם בה פוסטים, הסביר את אופן פעולת האלגוריתם:

    "המודל מחליט מתי להקשיב. הוא ממתין קצת יותר במילים קשות ומחויב מהר יותר במילים קלות, תוך שימוש בשיהוי מסתגל כדי לחזות כל טוקן ולהגדיל את הדיוק."

    בנוסף, צוקרברג הדגיש את עמידות המודל בתנאי שמע מורכבים במציאות:

    "הוא מחזיק מעמד גם באודיו אמיתי ומבולגן - מאומן על יותר מ-70 שפות (עם 25 מאומתות בהשקה), מתמודד עם מעבר בין שפות באמצע משפט, ומנהל פגישות של שעה עם יותר מ-20 דוברים."

    המפתח של המודל טמון ביכולת לזהות באופן טבעי "Code-Switching" - מצב שבו הדוברים משלבים מילים משפות שונות באותו משפט - ולתמלל את הנאמר באופן רציף ללא צורך בהגדרות מוקדמות או בהחלפה ידנית של השפה.

    זמינות למפתחים, שילוב במוצרים ותמחור

    המודל החדש מופץ החל מהיום וזמין לשימוש במספר אופנים:

    • אפליקציית שולחן העבודה: המודל כבר משולב באפליקציית Meta AI ל-Mac שהושקה לאחרונה, שבה הוא מספק יכולות הכתבה קולית עבור אפליקציות שונות.

    • סביבת פיתוח: המודל משולב ישירות בתוך כלי הפיתוח Muse Code.

    • ממשק תכנות יישומים (API): מפתחים חיצוניים יכולים להשתמש במודל דרך Meta Model API בעלות של 3 דולר לכל 1,000 דקות אודיו.

    • גרסת הדגמה: החברה העמידה גרסת הדגמה (Demo) לציבור בבלוג המחקר שלה.

    אלכסנדר וואנג, מהדמויות המובילות במיזם, אישר ברשתות החברתיות כי המודל זמין כעת דרך ה-API של החברה וכבר מפעיל באופן פעיל את תכונות ההכתבה באפליקציית שולחן העבודה וב-Muse Code.

    התחרות מול גוגל במירוץ הקולי

    ההכרזה של מטא מגיעה פחות משבוע בלבד לאחר שגוגל הציגה את מודל האודיו המתחרה שלה, Google Gemini 3.5 Transcribe, המציע יכולות תמלול וזיהוי מתקדמות בדומה למודל של מטא.

    עם זאת, שתי החברות מציגות אסטרטגיית הפצה שונה. גוגל פועלת להטמעת מודל האודיו שלה בתוך מערכת ההפעלה אנדרואיד (Android) ובהמשך גם בדפדפן כרום (Chrome). לעומת זאת, במטא טרם הובהר אם ישנן תוכניות לשלב את Muse Voice Transcribe בשירותי הליבה והפלטפורמות המרכזיות של החברה.

    השקת המודל היא חלק מגל הכרזות תדיר שמפרסמת מעבדת Meta Superintelligence Lab (MSL). במהלך השבועות האחרונים הציגה המעבדה סדרה של כלי בינה מלאכותית חדשים, ובהם סוכן קידוד ייעודי ראשון (Coding Agent), מודל במשקלים פתוחים (Open-weight) ואפליקציית Meta AI למחשבי Mac.

    התוכן בכתבה זו נועד לספק סקירה כללית בלבד ואינו מהווה תחליף לייעוץ מקצועי פרטני. המערכת אינה אחראית לכל נזק או הפסד שייגרם כתוצאה מהסתמכות על המידע המוצג.

    שיתוף:
    האם אהבת את הכתבה?

    תגובות (0)

    טוען תגובות...

    רוצים לקבל עדכונים על עולם הטכנולוגיה?

    הצטרפו לניוזלטר שלנו וקבלו את החדשות ישירות למייל

    כתבות נוספות בקטגוריה