תמלול בעברית עם Gemini 3.5 Transcribe: מה עובד, כמה זה עולה ואיפה זה נעצר
גוגל שחררה ב-26 באוגוסט 2026 מודל תמלול חדש, ועברית נמצאת רשמית בטבלת השפות הנתמכות שלו. ריכזנו מה הוא יודע לעשות, כמה זה עולה לדקה, ואילו מגבלות כתובות במסמכים ולא מופיעות בהודעות לעיתונות.
Gemini 3.5 Transcribe הוא מודל התמלול החדש של גוגל, שיצא לתצוגה מקדימה ציבורית ב-26 באוגוסט 2026. הוא מגיע בשני נתיבים נפרדים, אחד לקבצים מוקלטים ואחד לזרימה חיה, ולכל אחד יכולות ומגבלות אחרות. עברית מופיעה בטבלת השפות הרשמית של גוגל עם הקוד he-IL, אבל גוגל לא פרסמה שיעור שגיאות נפרד לעברית.
מי שניסה לתמלל הקלטה בעברית מכיר את התוצאה. שמות פרטיים שנשברים, מספרים שמתהפכים, ושתי דקות עבודה ידנית על כל דקת אודיו. ב-26 באוגוסט 2026 גוגל שחררה מודל חדש שמנסה לפתור בדיוק את זה, ובטבלת השפות שלו עברית מופיעה במפורש.
המודל נקרא Gemini 3.5 Transcribe והוא בתצוגה מקדימה ציבורית. הוא כבר מריץ את Rambler במקלדת של אנדרואיד ואת אפליקציית Gemini ל-macOS. עברנו על המסמכים הרשמיים של גוגל, השווינו אותם לכיסוי התקשורתי, ובדקנו מה זה אומר בפועל למי שמתמלל בעברית.
מה זה Gemini 3.5 Transcribe ולמה זה לא עוד מנוע תמלול
רוב מנועי התמלול ממירים גלי קול לטקסט ועוצרים שם. המודל החדש בנוי על יכולות הבנת האודיו של ג'מיני, ולכן הוא גם מנקה רעש, מוסיף פיסוק ומעצב את הפלט. גוגל מתארת אותו כמודל התמלול המדויק שלה עד היום, ומדגישה שהוא מתמודד עם מבטאים, רעש רקע ושיחות רב-לשוניות.
הוא נשלח בשני קצוות נפרדים ולא באחד. gemini-3.5-transcribe מטפל בקבצים מוקלטים דרך Interactions API, ו-gemini-3.5-transcribe-live מטפל בזרימה דו-כיוונית דרך Live API. לשני הקצוות אין אותן יכולות, אותן מגבלות ואותו מחיר, וזו הנקודה שהכי כדאי להבין לפני שבונים משהו מעליהם.
שיעור השגיאות של 2.6% ו-4.0% הוא ממוצע חוצה שפות. במדד FLEURS הרב-לשוני המספרים גבוהים יותר, 5.04% על קובץ ו-5.50% בזרימה. גוגל לא פרסמה שיעור שגיאות נפרד לעברית, ולכן אין נתון רשמי שאפשר לצטט על איכות התמלול בעברית בלבד.
שש היכולות שמשנות את התמלול בפועל
01זיהוי שפה אוטומטי, גם באמצע משפט
אם לא מציינים שפה מראש, המודל מזהה אותה לבד מתוך יותר מ-85 שפות. הוא גם מטפל במעבר בין שפות באותו משפט בלי הגדרה מיוחדת, וזה בדיוק הדפוס של דיבור ישראלי שמערבב עברית ואנגלית. מי שיודע מראש שההקלטה בעברית יכול להעביר את הקוד he-IL בשדה language_codes, וגוגל ממליצה לעשות את זה כדי לשפר דיוק.
02מצב smart שמנקה גמגומים ותיקונים עצמיים
ברירת המחדל היא verbatim, תמלול מילה במילה שמשאיר כל היסוס. מצב smart מסיר מילות מילוי, פותר תיקונים בתוך המשפט, ומסדר את הטקסט לפסקאות ולרשימות ממוספרות. בדוגמה שגוגל מביאה, אמירה מגומגמת שכוללת תיקון של שם ושל יום חוזרת כמשפט אחד נקי עם הערכים המתוקנים בלבד.
03אוצר מילים מותאם עד 1,000 מונחים
אפשר להזין רשימת מונחים שתטה את הזיהוי: שמות מותגים, ראשי תיבות, שמות פרטיים או ז'רגון מקצועי. המגבלה הרשמית היא 1,000 ביטויים, אבל גוגל כותבת שהתוצאות הטובות ביותר מתקבלות עד 100. בעברית זה כנראה השדה שיעשה את ההבדל הגדול ביותר, כי שמות ישראליים הם החולשה הקלאסית של מנועי תמלול.
04זיהוי דוברים עד שמונה, ולא שלושה
חלק מהכתבות שסיקרו את ההשקה כתבו שהמודל מזהה עד שלושה דוברים. במסמכי המפתחים של גוגל כתוב אחרת: התמיכה היא עד שמונה דוברים, וייחוס הדיבור לשלושה ומעלה מוגדר ניסיוני. כל דובר מקבל תווית כמו spk_1, והיכולת זמינה רק בקבצים מוקלטים.
05חותמות זמן ברמת מילה, עם מחיר נסתר
אפשר לקבל זמן התחלה וסיום לכל מילה, מה שנדרש לכתוביות ולעריכת וידאו. גוגל מוסיפה הערה שכדאי לקרוא לפני שמפעילים: חותמות זמן ברמת מילה עלולות לפגוע בדיוק התמלול הכללי. זו החלטה שצריך לקבל לפי סוג העבודה, לא כברירת מחדל.
06הפעלת פעולות בקול
המודל תומך בקריאה לפונקציות, ולכן הוא יכול להעביר משימות מורכבות למודלים אחרים במשפחה, למשל יצירת תמונה או ניתוח קובץ. זה מה שמאפשר את היכולת Speak to Window באפליקציית Gemini ל-macOS. פרקטית זה הופך את התמלול לשכבת קלט של מערכת, ולא רק לפלט טקסט.
ההבדל האמיתי אינו שיעור השגיאות אלא מה שקורה אחריו. מודל שמנקה היסוסים, מסדר רשימות ומזהה דוברים חוסך את שלב העריכה הידנית, וזה השלב שבאמת אוכל את הזמן.
שני מסלולים ושני מצבים: מה בוחרים ומתי
ההבדל בין הקצוות אינו טכני בלבד, הוא קובע מה תקבלו בפלט. הטבלה מסכמת את ההבדלים לפי המסמכים הרשמיים של גוגל, כדי שתדעו לאיזה מסלול ללכת עוד לפני שאתם מעלים קובץ.
| יכולת | קובץ, מצב verbatim | קובץ, מצב smart | תמלול חי (Live API) | Chirp 3, הדור הקודם |
|---|---|---|---|---|
| שיעור שגיאות מדווח | 2.6% | 2.6%, אותו מודל | 4.0% | שיפור מדווח, בלי מספר משווה |
| זמן עד תמלול סופי | מהיר ב-70% | מהיר ב-70% | תת-שנייה, זרימה רציפה | בסיס ההשוואה |
| אורך אודיו מרבי | שעה, ו-30 דקות עם דוברים | שעה | סשן של 10 דקות | לא פורסם במסמכי המודל החדש |
| זיהוי דוברים | עד 8, מעל 3 ניסיוני | לא זמין במצב הזה | לא נתמך | לא פורסם במסמכי המודל החדש |
| חותמות זמן ברמת מילה | כן, עלול לפגוע בדיוק | לא זמין במצב הזה | לא נתמך | לא פורסם במסמכי המודל החדש |
הכלל הפשוט: תמלול שנועד להיקרא הולך ל-smart, תמלול שנועד להיבדק הולך ל-verbatim עם חותמות זמן וזיהוי דוברים. אי אפשר לקבל את שניהם בקריאה אחת, וזו ההחלטה המרכזית בתכנון. מי שמשווה גם מול מודלים כלליים במשפחה ימצא בסקירה שלנו על Gemini 3.7 Flash את ההבדל בין מודל רב-תכליתי למודל ייעודי לתמלול.
עברית: מה גוגל מתחייבת אליו, ומה לא
בטבלת השפות הנתמכות במסמכי המפתחים של גוגל עברית מופיעה במפורש, עם הקוד he-IL. זו לא הצהרה שיווקית אלא רשומה בתיעוד הטכני, ומשמעותה שאפשר להעביר את הקוד בשדה language_codes ולקבל תמלול ממוקד. גוגל ממליצה לעשות את זה כשיודעים את שפת ההקלטה מראש, כדי למקסם דיוק.
מה שאין הוא מספר. גוגל פרסמה ממוצע חוצה שפות ותוצאה על מדד FLEURS, בלי פירוט לפי שפה, ולכן אין נתון רשמי על שיעור השגיאות בעברית. הפער בין 2.6% הממוצע ל-5.04% במדד הרב-לשוני מרמז שהשפות הקטנות משלמות מחיר. עד שיהיו בדיקות עצמאיות בעברית, הדרך היחידה לדעת היא לתמלל דגימה משלכם ולספור. רקע רחב יותר על משפחת המודלים יש במדריך ג'מיני של אי ראנק.
המודל זמין בתצוגה מקדימה דרך ה-API, ב-Google AI Studio ובפלטפורמת הארגונים. אין ממשק שבו גוררים קובץ ומקבלים מסמך מוכן. משתמש הקצה פוגש אותו כרגע רק בעקיפין, דרך Rambler במקלדת אנדרואיד ואפליקציית Gemini ל-macOS, ותמיכה בכרום הוכרזה כשלב הבא.
כמה זה עולה
אפשר להתחיל בחינם. השכבה החינמית של Gemini API דרך Google AI Studio פתוחה לכל מפתח ומיועדת לבדיקות ולנפחים קטנים. השכבה בתשלום מעלה את מכסות הקצב, וגוגל מציינת שבה התוכן אינו משמש לשיפור המוצרים שלה. לפי הניתוח של MarkTechPost העלות המשוקללת עומדת על כ-0.005 דולר לדקת אודיו בעיבוד קובץ, וכ-0.009 דולר לדקה בתמלול חי. במספרים האלה שעת הקלטה מתומללת עולה בערך שליש דולר, זול משמעותית מתמלול אנושי, אבל מחייב חשבון מפתחים ולא רק דפדפן. מי שמשווה עלויות מול כלים אחרים ימצא את התמונה הרחבה בריכוז כלי ה-AI המומלצים שלנו ל-2026.
איך מתחילים, שלושה צעדים
אין כאן אשף התקנה. הדרך המהירה ביותר לראות תוצאה בעברית עוברת דרך Google AI Studio, ולוקחת בערך רבע שעה.
01פותחים חשבון ומייצרים מפתח API
נכנסים ל-Google AI Studio עם חשבון גוגל רגיל ומייצרים מפתח. השכבה החינמית מספיקה כדי לבדוק קובץ או שניים ולראות איך המודל מתמודד עם ההקלטות שלכם, לפני שמחליטים על תשלום.
02מעלים קובץ ומעבירים אותו למודל
לקבצים ארוכים מכמה שניות גוגל ממליצה להעלות דרך Files API ולהעביר את הכתובת שחוזרת. הפורמטים הנתמכים כוללים MP3, WAV, M4A, FLAC, OGG, Opus ו-WebM, כך שרוב ההקלטות מהטלפון עוברות בלי המרה.
03בוחרים מצב לפי מה שאתם צריכים
מגדירים he-IL בשדה השפה, ומחליטים בין smart לתמלול קריא לבין verbatim עם זיהוי דוברים וחותמות זמן לתמלול שצריך אימות. אם ההקלטה מלאה בשמות ובמונחים חוזרים, מוסיפים אותם לאוצר המילים המותאם לפני ההרצה.
למי זה מתאים היום, ולמי כדאי לחכות
- אתם מפתחים או בעלי מוצר שצריך תמלול בתוך מערכת קיימת
- אתם מתמללים ישיבות או ראיונות בעברית ומוכנים לעבוד מול API
- אתם צריכים זיהוי דוברים או חותמות זמן ברמת מילה
- ההקלטות שלכם מערבבות עברית ואנגלית באותו משפט
- אתם בונים תמלול חי בזמן אמת בתוך אפליקציה
- אתם מחפשים כלי דפדפן שגוררים אליו קובץ ומקבלים מסמך
- אתם צריכים התחייבות לרמת שירות, המוצר עדיין בתצוגה מקדימה
- ההקלטות שלכם ארוכות משעה ואתם לא רוצים לפצל אותן
- אתם צריכים גם ניקוי היסוסים וגם זיהוי דוברים באותה קריאה
- אתם מסתמכים על שיעור שגיאות מתועד בעברית, ואין כזה
✓מה חשוב לזכור
- המודל יצא ב-26 באוגוסט 2026 בתצוגה מקדימה ציבורית, לא בגרסה יציבה.
- עברית נמצאת רשמית בטבלת השפות עם הקוד he-IL, אבל בלי נתון שגיאות ייעודי.
- יש שני קצוות נפרדים, קובץ מוקלט וזרימה חיה, והם אינם זהים ביכולות.
- מצב smart לא מסתדר עם חותמות זמן ועם זיהוי דוברים, צריך לבחור אחד.
- המגבלות הקשיחות: שעה לקובץ, 30 דקות עם זיהוי דוברים, 10 דקות לסשן חי.
שאלות ותשובות
האם Gemini 3.5 Transcribe תומך בעברית? ▼
כן. עברית מופיעה בטבלת השפות הנתמכות במסמכי המפתחים של גוגל עם הקוד he-IL, ואפשר להעביר את הקוד הזה בשדה language_codes כדי לשפר את הדיוק. גוגל לא פרסמה שיעור שגיאות נפרד לעברית, ולכן אין נתון רשמי על איכות התמלול בעברית בלבד.
כמה עולה תמלול בעברית עם המודל הזה? ▼
אפשר להתחיל בחינם בשכבה החינמית של Gemini API דרך Google AI Studio. לפי ניתוח של MarkTechPost העלות המשוקללת היא כ-0.005 דולר לדקת אודיו בעיבוד קובץ וכ-0.009 דולר לדקה בתמלול חי, כלומר כשליש דולר לשעת הקלטה.
מה ההבדל בין מצב verbatim למצב smart? ▼
verbatim הוא ברירת המחדל ומחזיר תמלול מילה במילה, כולל מילות מילוי, חזרות והתחלות שווא. smart מסיר היסוסים, פותר תיקונים עצמיים בתוך המשפט, ומעצב את הטקסט לפסקאות ולרשימות. אי אפשר לשלב smart עם חותמות זמן או עם זיהוי דוברים.
כמה דוברים המודל יודע להפריד? ▼
לפי מסמכי גוגל התמיכה היא עד שמונה דוברים, וייחוס הדיבור לשלושה דוברים ומעלה מוגדר ניסיוני. זיהוי דוברים זמין רק בקבצים מוקלטים ולא בתמלול חי דרך Live API.
מה אורך ההקלטה המרבי? ▼
בקשה רגילה תומכת בקובץ אודיו של עד שעה. כשמפעילים זיהוי דוברים או חותמות זמן ברמת מילה המגבלה יורדת ל-30 דקות. סשן של תמלול חי מוגבל ל-10 דקות של זרימה רציפה.
האם יש ממשק פשוט בלי תכנות? ▼
אין ממשק העלאה ייעודי. המודל זמין דרך ה-API, ב-Google AI Studio ובפלטפורמת הארגונים של גוגל. משתמשי קצה פוגשים אותו דרך Rambler במקלדת אנדרואיד ואפליקציית Gemini ל-macOS, ותמיכה בכרום הוכרזה כשלב הבא.