AI Rank אי ראנק

אי ראנק לוגו
המצפן שלך בעולם הבינה המלאכותית
הלוחש לגיפיטי
חדש ✨
הלוחש לגיפיטי
לחצו כאן ➔
דירוג אי‑ראנק: 4.4
סקירת כלי תמלול AI

תמלול בעברית עם Gemini 3.5 Transcribe: מה עובד, כמה זה עולה ואיפה זה נעצר

גוגל שחררה ב-26 באוגוסט 2026 מודל תמלול חדש, ועברית נמצאת רשמית בטבלת השפות הנתמכות שלו. ריכזנו מה הוא יודע לעשות, כמה זה עולה לדקה, ואילו מגבלות כתובות במסמכים ולא מופיעות בהודעות לעיתונות.

פורסם 30 באוגוסט 2026 · עודכן 30 באוגוסט 2026 · זמן קריאה: 7 דקות · מאת צוות AIRANK
+400
סקירות שפורסמו
+3
שנות פעילות בתחום
300
כלים שנסקרו
8.6
ציון הכלי הנסקר

Gemini 3.5 Transcribe הוא מודל התמלול החדש של גוגל, שיצא לתצוגה מקדימה ציבורית ב-26 באוגוסט 2026. הוא מגיע בשני נתיבים נפרדים, אחד לקבצים מוקלטים ואחד לזרימה חיה, ולכל אחד יכולות ומגבלות אחרות. עברית מופיעה בטבלת השפות הרשמית של גוגל עם הקוד he-IL, אבל גוגל לא פרסמה שיעור שגיאות נפרד לעברית.

תאריך השקה26.08.2026, תצוגה מקדימה ציבורית
שיעור שגיאות מדווח2.6% על קובץ, 4.0% בזרימה חיה
עבריתנתמכת רשמית, קוד he-IL
מחיר משוערכ-0.005 דולר לדקת אודיו בקובץ
תמלול בעברית עם Gemini 3.5 Transcribe, מודל דיבור לטקסט של גוגל
Gemini 3.5 Transcribe, מודל התמלול שגוגל שחררה בסוף אוגוסט 2026

מי שניסה לתמלל הקלטה בעברית מכיר את התוצאה. שמות פרטיים שנשברים, מספרים שמתהפכים, ושתי דקות עבודה ידנית על כל דקת אודיו. ב-26 באוגוסט 2026 גוגל שחררה מודל חדש שמנסה לפתור בדיוק את זה, ובטבלת השפות שלו עברית מופיעה במפורש.

המודל נקרא Gemini 3.5 Transcribe והוא בתצוגה מקדימה ציבורית. הוא כבר מריץ את Rambler במקלדת של אנדרואיד ואת אפליקציית Gemini ל-macOS. עברנו על המסמכים הרשמיים של גוגל, השווינו אותם לכיסוי התקשורתי, ובדקנו מה זה אומר בפועל למי שמתמלל בעברית.

מה זה Gemini 3.5 Transcribe ולמה זה לא עוד מנוע תמלול

רוב מנועי התמלול ממירים גלי קול לטקסט ועוצרים שם. המודל החדש בנוי על יכולות הבנת האודיו של ג'מיני, ולכן הוא גם מנקה רעש, מוסיף פיסוק ומעצב את הפלט. גוגל מתארת אותו כמודל התמלול המדויק שלה עד היום, ומדגישה שהוא מתמודד עם מבטאים, רעש רקע ושיחות רב-לשוניות.

הוא נשלח בשני קצוות נפרדים ולא באחד. gemini-3.5-transcribe מטפל בקבצים מוקלטים דרך Interactions API, ו-gemini-3.5-transcribe-live מטפל בזרימה דו-כיוונית דרך Live API. לשני הקצוות אין אותן יכולות, אותן מגבלות ואותו מחיר, וזו הנקודה שהכי כדאי להבין לפני שבונים משהו מעליהם.

2.6%
שיעור שגיאות מילים על קובץ מוקלט
85+
שפות בזיהוי אוטומטי, כולל עברית
70%
קיצור הזמן עד תמלול סופי מול Chirp 3
המספרים הם של גוגל, נמדדו על ידי Artificial Analysis

שיעור השגיאות של 2.6% ו-4.0% הוא ממוצע חוצה שפות. במדד FLEURS הרב-לשוני המספרים גבוהים יותר, 5.04% על קובץ ו-5.50% בזרימה. גוגל לא פרסמה שיעור שגיאות נפרד לעברית, ולכן אין נתון רשמי שאפשר לצטט על איכות התמלול בעברית בלבד.

שש היכולות שמשנות את התמלול בפועל

01זיהוי שפה אוטומטי, גם באמצע משפט

אם לא מציינים שפה מראש, המודל מזהה אותה לבד מתוך יותר מ-85 שפות. הוא גם מטפל במעבר בין שפות באותו משפט בלי הגדרה מיוחדת, וזה בדיוק הדפוס של דיבור ישראלי שמערבב עברית ואנגלית. מי שיודע מראש שההקלטה בעברית יכול להעביר את הקוד he-IL בשדה language_codes, וגוגל ממליצה לעשות את זה כדי לשפר דיוק.

02מצב smart שמנקה גמגומים ותיקונים עצמיים

ברירת המחדל היא verbatim, תמלול מילה במילה שמשאיר כל היסוס. מצב smart מסיר מילות מילוי, פותר תיקונים בתוך המשפט, ומסדר את הטקסט לפסקאות ולרשימות ממוספרות. בדוגמה שגוגל מביאה, אמירה מגומגמת שכוללת תיקון של שם ושל יום חוזרת כמשפט אחד נקי עם הערכים המתוקנים בלבד.

03אוצר מילים מותאם עד 1,000 מונחים

אפשר להזין רשימת מונחים שתטה את הזיהוי: שמות מותגים, ראשי תיבות, שמות פרטיים או ז'רגון מקצועי. המגבלה הרשמית היא 1,000 ביטויים, אבל גוגל כותבת שהתוצאות הטובות ביותר מתקבלות עד 100. בעברית זה כנראה השדה שיעשה את ההבדל הגדול ביותר, כי שמות ישראליים הם החולשה הקלאסית של מנועי תמלול.

!
רוצים להכתיב במקום להקליד? סקרנו את Wispr Flow, כלי ההכתבה שממיר דיבור לטקסט ערוך בתוך כל אפליקציה במחשב.
לסקירת Wispr Flow ←

04זיהוי דוברים עד שמונה, ולא שלושה

חלק מהכתבות שסיקרו את ההשקה כתבו שהמודל מזהה עד שלושה דוברים. במסמכי המפתחים של גוגל כתוב אחרת: התמיכה היא עד שמונה דוברים, וייחוס הדיבור לשלושה ומעלה מוגדר ניסיוני. כל דובר מקבל תווית כמו spk_1, והיכולת זמינה רק בקבצים מוקלטים.

05חותמות זמן ברמת מילה, עם מחיר נסתר

אפשר לקבל זמן התחלה וסיום לכל מילה, מה שנדרש לכתוביות ולעריכת וידאו. גוגל מוסיפה הערה שכדאי לקרוא לפני שמפעילים: חותמות זמן ברמת מילה עלולות לפגוע בדיוק התמלול הכללי. זו החלטה שצריך לקבל לפי סוג העבודה, לא כברירת מחדל.

06הפעלת פעולות בקול

המודל תומך בקריאה לפונקציות, ולכן הוא יכול להעביר משימות מורכבות למודלים אחרים במשפחה, למשל יצירת תמונה או ניתוח קובץ. זה מה שמאפשר את היכולת Speak to Window באפליקציית Gemini ל-macOS. פרקטית זה הופך את התמלול לשכבת קלט של מערכת, ולא רק לפלט טקסט.

ההבדל האמיתי אינו שיעור השגיאות אלא מה שקורה אחריו. מודל שמנקה היסוסים, מסדר רשימות ומזהה דוברים חוסך את שלב העריכה הידנית, וזה השלב שבאמת אוכל את הזמן.

שני מסלולים ושני מצבים: מה בוחרים ומתי

ההבדל בין הקצוות אינו טכני בלבד, הוא קובע מה תקבלו בפלט. הטבלה מסכמת את ההבדלים לפי המסמכים הרשמיים של גוגל, כדי שתדעו לאיזה מסלול ללכת עוד לפני שאתם מעלים קובץ.

יכולת קובץ, מצב verbatim קובץ, מצב smart תמלול חי (Live API) Chirp 3, הדור הקודם
שיעור שגיאות מדווח 2.6%, אותו מודל 4.0% שיפור מדווח, בלי מספר משווה
זמן עד תמלול סופי מהיר ב-70% תת-שנייה, זרימה רציפה בסיס ההשוואה
אורך אודיו מרבי שעה סשן של 10 דקות לא פורסם במסמכי המודל החדש
זיהוי דוברים לא זמין במצב הזה לא נתמך לא פורסם במסמכי המודל החדש
חותמות זמן ברמת מילה לא זמין במצב הזה לא נתמך לא פורסם במסמכי המודל החדש

הכלל הפשוט: תמלול שנועד להיקרא הולך ל-smart, תמלול שנועד להיבדק הולך ל-verbatim עם חותמות זמן וזיהוי דוברים. אי אפשר לקבל את שניהם בקריאה אחת, וזו ההחלטה המרכזית בתכנון. מי שמשווה גם מול מודלים כלליים במשפחה ימצא בסקירה שלנו על Gemini 3.7 Flash את ההבדל בין מודל רב-תכליתי למודל ייעודי לתמלול.

עברית: מה גוגל מתחייבת אליו, ומה לא

בטבלת השפות הנתמכות במסמכי המפתחים של גוגל עברית מופיעה במפורש, עם הקוד he-IL. זו לא הצהרה שיווקית אלא רשומה בתיעוד הטכני, ומשמעותה שאפשר להעביר את הקוד בשדה language_codes ולקבל תמלול ממוקד. גוגל ממליצה לעשות את זה כשיודעים את שפת ההקלטה מראש, כדי למקסם דיוק.

מה שאין הוא מספר. גוגל פרסמה ממוצע חוצה שפות ותוצאה על מדד FLEURS, בלי פירוט לפי שפה, ולכן אין נתון רשמי על שיעור השגיאות בעברית. הפער בין 2.6% הממוצע ל-5.04% במדד הרב-לשוני מרמז שהשפות הקטנות משלמות מחיר. עד שיהיו בדיקות עצמאיות בעברית, הדרך היחידה לדעת היא לתמלל דגימה משלכם ולספור. רקע רחב יותר על משפחת המודלים יש במדריך ג'מיני של אי ראנק.

זה עדיין לא כלי לקהל הרחב

המודל זמין בתצוגה מקדימה דרך ה-API, ב-Google AI Studio ובפלטפורמת הארגונים. אין ממשק שבו גוררים קובץ ומקבלים מסמך מוכן. משתמש הקצה פוגש אותו כרגע רק בעקיפין, דרך Rambler במקלדת אנדרואיד ואפליקציית Gemini ל-macOS, ותמיכה בכרום הוכרזה כשלב הבא.

כמה זה עולה

אפשר להתחיל בחינם. השכבה החינמית של Gemini API דרך Google AI Studio פתוחה לכל מפתח ומיועדת לבדיקות ולנפחים קטנים. השכבה בתשלום מעלה את מכסות הקצב, וגוגל מציינת שבה התוכן אינו משמש לשיפור המוצרים שלה. לפי הניתוח של MarkTechPost העלות המשוקללת עומדת על כ-0.005 דולר לדקת אודיו בעיבוד קובץ, וכ-0.009 דולר לדקה בתמלול חי. במספרים האלה שעת הקלטה מתומללת עולה בערך שליש דולר, זול משמעותית מתמלול אנושי, אבל מחייב חשבון מפתחים ולא רק דפדפן. מי שמשווה עלויות מול כלים אחרים ימצא את התמונה הרחבה בריכוז כלי ה-AI המומלצים שלנו ל-2026.

0.005$
לדקת אודיו בעיבוד קובץ (הערכה)
0.009$
לדקה בתמלול חי (הערכה)
חינם
שכבת התנסות ב-Google AI Studio

איך מתחילים, שלושה צעדים

אין כאן אשף התקנה. הדרך המהירה ביותר לראות תוצאה בעברית עוברת דרך Google AI Studio, ולוקחת בערך רבע שעה.

01פותחים חשבון ומייצרים מפתח API

נכנסים ל-Google AI Studio עם חשבון גוגל רגיל ומייצרים מפתח. השכבה החינמית מספיקה כדי לבדוק קובץ או שניים ולראות איך המודל מתמודד עם ההקלטות שלכם, לפני שמחליטים על תשלום.

02מעלים קובץ ומעבירים אותו למודל

לקבצים ארוכים מכמה שניות גוגל ממליצה להעלות דרך Files API ולהעביר את הכתובת שחוזרת. הפורמטים הנתמכים כוללים MP3, WAV, M4A, FLAC, OGG, Opus ו-WebM, כך שרוב ההקלטות מהטלפון עוברות בלי המרה.

03בוחרים מצב לפי מה שאתם צריכים

מגדירים he-IL בשדה השפה, ומחליטים בין smart לתמלול קריא לבין verbatim עם זיהוי דוברים וחותמות זמן לתמלול שצריך אימות. אם ההקלטה מלאה בשמות ובמונחים חוזרים, מוסיפים אותם לאוצר המילים המותאם לפני ההרצה.

למי זה מתאים היום, ולמי כדאי לחכות

מתאים לכם אם
  • אתם מפתחים או בעלי מוצר שצריך תמלול בתוך מערכת קיימת
  • אתם מתמללים ישיבות או ראיונות בעברית ומוכנים לעבוד מול API
  • אתם צריכים זיהוי דוברים או חותמות זמן ברמת מילה
  • ההקלטות שלכם מערבבות עברית ואנגלית באותו משפט
  • אתם בונים תמלול חי בזמן אמת בתוך אפליקציה
כדאי לחכות אם
  • אתם מחפשים כלי דפדפן שגוררים אליו קובץ ומקבלים מסמך
  • אתם צריכים התחייבות לרמת שירות, המוצר עדיין בתצוגה מקדימה
  • ההקלטות שלכם ארוכות משעה ואתם לא רוצים לפצל אותן
  • אתם צריכים גם ניקוי היסוסים וגם זיהוי דוברים באותה קריאה
  • אתם מסתמכים על שיעור שגיאות מתועד בעברית, ואין כזה

מה חשוב לזכור

  1. המודל יצא ב-26 באוגוסט 2026 בתצוגה מקדימה ציבורית, לא בגרסה יציבה.
  2. עברית נמצאת רשמית בטבלת השפות עם הקוד he-IL, אבל בלי נתון שגיאות ייעודי.
  3. יש שני קצוות נפרדים, קובץ מוקלט וזרימה חיה, והם אינם זהים ביכולות.
  4. מצב smart לא מסתדר עם חותמות זמן ועם זיהוי דוברים, צריך לבחור אחד.
  5. המגבלות הקשיחות: שעה לקובץ, 30 דקות עם זיהוי דוברים, 10 דקות לסשן חי.

שאלות ותשובות

האם Gemini 3.5 Transcribe תומך בעברית?

כן. עברית מופיעה בטבלת השפות הנתמכות במסמכי המפתחים של גוגל עם הקוד he-IL, ואפשר להעביר את הקוד הזה בשדה language_codes כדי לשפר את הדיוק. גוגל לא פרסמה שיעור שגיאות נפרד לעברית, ולכן אין נתון רשמי על איכות התמלול בעברית בלבד.

כמה עולה תמלול בעברית עם המודל הזה?

אפשר להתחיל בחינם בשכבה החינמית של Gemini API דרך Google AI Studio. לפי ניתוח של MarkTechPost העלות המשוקללת היא כ-0.005 דולר לדקת אודיו בעיבוד קובץ וכ-0.009 דולר לדקה בתמלול חי, כלומר כשליש דולר לשעת הקלטה.

מה ההבדל בין מצב verbatim למצב smart?

verbatim הוא ברירת המחדל ומחזיר תמלול מילה במילה, כולל מילות מילוי, חזרות והתחלות שווא. smart מסיר היסוסים, פותר תיקונים עצמיים בתוך המשפט, ומעצב את הטקסט לפסקאות ולרשימות. אי אפשר לשלב smart עם חותמות זמן או עם זיהוי דוברים.

כמה דוברים המודל יודע להפריד?

לפי מסמכי גוגל התמיכה היא עד שמונה דוברים, וייחוס הדיבור לשלושה דוברים ומעלה מוגדר ניסיוני. זיהוי דוברים זמין רק בקבצים מוקלטים ולא בתמלול חי דרך Live API.

מה אורך ההקלטה המרבי?

בקשה רגילה תומכת בקובץ אודיו של עד שעה. כשמפעילים זיהוי דוברים או חותמות זמן ברמת מילה המגבלה יורדת ל-30 דקות. סשן של תמלול חי מוגבל ל-10 דקות של זרימה רציפה.

האם יש ממשק פשוט בלי תכנות?

אין ממשק העלאה ייעודי. המודל זמין דרך ה-API, ב-Google AI Studio ובפלטפורמת הארגונים של גוגל. משתמשי קצה פוגשים אותו דרך Rambler במקלדת אנדרואיד ואפליקציית Gemini ל-macOS, ותמיכה בכרום הוכרזה כשלב הבא.

· AIRANK · הדירוג העצמאי של כלי AI ·

מצא את הכלי המתאים עבורך עם אי-ראנק

בחירה בכלי AI לא צריכה להיות הימור. ב-AIRANK נסקרו למעלה מ-300 כלים, עם השוואות, מחירים ודירוגים עצמאיים בעברית, כדי שתמצאו את מה שבאמת מתאים לכם.

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *