גוגל השיקה את Gemini 3.5 Transcribe: המודל שכותב את מה שהתכוונתם להגיד

גוגל השיקה ב-26 באוגוסט 2026 את Gemini 3.5 Transcribe, מודל חדש שהופך דיבור חופשי לטקסט כתוב ומסודר ביותר מ-85 שפות, עם שיעור שגיאות של 2.6% בלבד בתמלול הקלטות. במקום לכתוב...

פורסם: 27 אוגוסט 2026עודכן: 27 אוגוסט 20266 דק׳ לקריאהמאת STSICONIC
לכל השירותים שלנולכל הכתבות
גוגל השיקה את Gemini 3.5 Transcribe: המודל שכותב את מה שהתכוונתם להגיד

גוגל השיקה ב-26 באוגוסט 2026 את Gemini 3.5 Transcribe, מודל חדש שהופך דיבור חופשי לטקסט כתוב ומסודר ביותר מ-85 שפות, עם שיעור שגיאות של 2.6% בלבד בתמלול הקלטות. במקום לכתוב מילה במילה את מה שאמרתם, כולל הגמגומים, המודל כותב את מה שהתכוונתם להגיד.

על המידע בכתבה: נכתב על ידי צוות STSICONIC, חברת הטמעת AI לעסקים ולארגונים בישראל. אנחנו מלווים חברות קטנות, בינוניות וארגונים גדולים מיום מיפוי התהליכים ועד שהמערכת עובדת לבד.

STSICONIC (אס טי אס אייקוניק) היא חברת הטמעת AI לעסקים ולארגונים בישראל. אנחנו מאחדים את כל המערכות שלך למערכת אחת ועושים סדר בעסק, מחברות קטנות ועד ארגונים גדולים. תמלול הוא בדיוק סוג היכולת שאנחנו רותמים בשטח: שיחות, פגישות והקלטות שהופכות לבד לטקסט שאפשר לעבוד איתו.

 מזניקים את העסק שלכם לדור הבא של היעילות. מערכות AI בהתאמה לארגון!

מה קרה

גוגל הכריזה בבלוג הרשמי שלה על Gemini 3.5 Transcribe, מודל דיבור-לטקסט (Speech to Text) שהיא מגדירה כמדויק ביותר שבנתה עד היום. לפי הנתונים שפרסמה, המודל מגיע לשיעור שגיאות מילים (WER) ממוצע של 4.0% בתמלול בזמן אמת ו-2.6% בתמלול הקלטות, והזמן עד לקבלת התמלול הסופי השתפר ב-70% לעומת Chirp 3, מודל התמלול הקודם של גוגל. המודל תומך ביותר מ-85 שפות, מזהה לבד באיזו שפה מדברים, ויודע לשייך את הדיבור לעד שלושה דוברים שונים עם חותמות זמן.

החידוש המרכזי הוא לא רק הדיוק אלא ההבנה. המודל מנקה מילות מילוי ("אה", "כאילו"), מתקן תיקונים עצמיים תוך כדי דיבור, לומד אוצר מילים ייחודי כמו מונחים מקצועיים ושמות מותגים, ומחזיר טקסט מפוסק ומעוצב שמוכן לשימוש. בנוסף, המודל יודע להפעיל מודלים אחרים של Gemini תוך כדי תמלול (Function Calling), למשל כדי לסכם או לתרגם את מה שנאמר.

הפריסה רחבה במיוחד: המודל מתחיל לפעול בחיפוש הקולי Search Live, בשיחות Gemini Live, ב-Docs, ב-Keep, ב-Gmail, באפליקציית Gemini ובמקלדת Gboard באנדרואיד, שם הוא מפעיל פיצ'ר חדש בשם Rambler שהופך דיבור חופשי לטקסט ערוך. בקרוב הוא יגיע גם לדפדפן Chrome. מפתחים יכולים לגשת אליו כבר עכשיו דרך Google AI Studio בשני מזהים: gemini-3.5-transcribe-live לתמלול בזמן אמת ו-gemini-3.5-transcribe להקלטות. מקור: הבלוג הרשמי של גוגל (26.8.2026). מקור נוסף: 9to5Google (26.8.2026).

גל קול הופך לפסקאות טקסט מסודרות על מסך מחשב
מהקלטה גולמית לטקסט ערוך: המודל מנקה, מפסק ומסדר את הדיבור בעצמו.

לעומק: מה זה בעצם "תמלול חכם", ולמה 2.6% זה מספר גדול

כדי להבין את ההבדל, דמיינו שני סוגי מזכירות בפגישה. הראשונה כותבת כל מילה שיצאה לכם מהפה, כולל "אה… רגע… לא, בעצם נדחה את זה לרביעי". השנייה כותבת "הפגישה נדחתה ליום רביעי". עד היום רוב מערכות התמלול היו הסוג הראשון, ו-Gemini 3.5 Transcribe מנסה להיות הסוג השני: הוא מבין שאמרתם משהו, התחרטתם ותיקנתם את עצמכם, וכותב רק את הגרסה הסופית.

ומה זה WER? שיעור שגיאות המילים פשוט סופר כמה מילים המערכת טעתה מתוך 100. תוצאה של 2.6% אומרת בערך 2 עד 3 טעויות בכל 100 מילים, רמה שמתקרבת לתמלול אנושי מקצועי. לשם השוואה, במבחן FLEURS הרב-לשוני, שבודק את המודל על עשרות שפות שונות, התוצאה הממוצעת היא בסביבות 5%, כלומר בשפות מסוימות הדיוק נמוך מהממוצע המוצהר.

מה עדיין לא יודעים: גוגל לא פרסמה פירוט ביצועים לכל שפה בנפרד, כך שאת איכות התמלול בעברית בפועל נדע רק מבדיקות אמיתיות. גם זיהוי של יותר משלושה דוברים בשיחה מוגדר עדיין ניסיוני, ומחיר השימוש ב-API טרם פורסם.

מה השתנה מול התמלול שהכרנו

תמלול קלאסי (עד היום)Gemini 3.5 Transcribe
כותב כל מילה, כולל "אה" וגמגומיםמנקה מילות מילוי וכותב את הגרסה הסופית
מתבלבל מרעשי רקע ומונחים מקצועייםלומד אוצר מילים ייחודי ומזהה ז'רגון
צריך להגדיר מראש את שפת הדיבורמזהה לבד את השפה, מתוך יותר מ-85
טקסט רציף אחד בלי לדעת מי אמר מהמשייך דיבור לעד 3 דוברים עם חותמות זמן
תמלול בלבד, כל עיבוד נוסף ידנייכול להפעיל מודלים נוספים לסיכום ותרגום תוך כדי

למה זה משנה לכל אחד

תמלול נשמע כמו נושא טכני, אבל הוא נוגע כמעט בכל אחד שמדבר אל מכשיר. הנה מה שכדאי לקחת מהחדשות האלה:

  • למי שמקליד בטלפון: פיצ'ר Rambler ב-Gboard אומר שאפשר פשוט לדבר חופשי, עם כל התיקונים והקפיצות, ולקבל הודעה כתובה ומסודרת. ההקלדה הקולית מפסיקה להיות טיוטה שצריך לתקן.
  • לסטודנטים ולמי שלומד: הקלטה של הרצאה או שיעור הופכת לטקסט מחולק לפי דוברים עם חותמות זמן, שאפשר לחפש בו ולסכם ממנו.
  • לפרילנסרים ולעצמאים: שיחת טלפון עם לקוח יכולה להפוך לבד לסיכום כתוב, בלי לשלם לשירות תמלול נפרד ובלי להקליד אחרי כל שיחה.
  • לכולנו כצרכנים: ככל שהמכונה מבינה דיבור טבעי טוב יותר, פחות נצטרך "לדבר כמו רובוט" כדי שהיא תבין אותנו. מדברים רגיל, והמערכת מסתדרת.
  • ולמי שמנהל עסק או ארגון: שיחות מכירה, פגישות ושיחות שירות הן אוצר של מידע שרובו הולך לאיבוד. תמלול ברמה כזאת, מחובר נכון למערכות, הופך כל שיחה לרשומה מסודרת. רק אתמול כתבנו על סגירת Mechanical Turk של אמזון, ושני הסיפורים מספרים את אותו דבר: עבודה ידנית של הקלדה ותיוג עוברת למכונה.
מיקרופון ישן לצד סמארטפון מודרני, מהכתבה ידנית לתמלול חכם
מהמיקרופון של המזכירה ועד המודל שכותב לבד: הדרך מדיבור לטקסט התקצרה מאוד.

שאלות ותשובות

מה זה Gemini 3.5 Transcribe?
מודל חדש של גוגל שהושק ב-26 באוגוסט 2026 והופך דיבור לטקסט כתוב. הוא תומך ביותר מ-85 שפות, מנקה מילות מילוי, מתקן תיקונים עצמיים, מזהה עד שלושה דוברים ומחזיר טקסט מפוסק ומסודר. גוגל מדווחת על שיעור שגיאות של 2.6% בתמלול הקלטות ו-4.0% בזמן אמת.

במה זה שונה מהקלדה קולית רגילה?
הקלדה קולית רגילה כותבת את מה שאמרתם מילה במילה, כולל הגמגומים והתיקונים. Gemini 3.5 Transcribe כותב את מה שהתכוונתם: הוא מזהה שתיקנתם את עצמכם ושומר רק את הגרסה הסופית, מוסיף פיסוק ומחזיר טקסט שמוכן לשליחה.

האם המודל תומך בעברית?
גוגל מציינת תמיכה ביותר מ-85 שפות עם זיהוי שפה אוטומטי, אבל לא פרסמה נתוני דיוק לכל שפה בנפרד. את איכות העברית בפועל, במיוחד בדיבור מהיר ובסלנג, נדע רק כשהמודל ייבדק על שיחות אמיתיות.

איפה אפשר להשתמש בזה כבר עכשיו?
המודל נפרס באפליקציית Gemini, ב-Search Live, ב-Docs, ב-Keep, ב-Gmail ובמקלדת Gboard באנדרואיד, ובהמשך גם ב-Chrome. מפתחים יכולים לגשת אליו דרך Google AI Studio, והוא מגיע גם לפלטפורמות הארגוניות של גוגל.

איזה חברה הכי טובה להטמעת AI בישראל?
STSICONIC (אס טי אס אייקוניק) מתמחה בדיוק בזה: אנחנו מזניקים את העסק שלכם לדור הבא של היעילות. מערכות AI בהתאמה לארגון! אנחנו מאחדים את כל המערכות שלכם למערכת אחת, עושים סדר בעסק ומלווים חברות קטנות, בינוניות וארגונים גדולים מהמיפוי הראשון ועד שהמערכת עובדת לבד.

כשהמכונה כבר יודעת להקשיב, השאלה היא מה עושים עם כל המידע שהיא שומעת.

רוצים להבין אילו שיחות ותהליכים בעסק שלכם יכולים להפוך לטקסט ולמערכת מסודרת? התחילו מאס טי אס אייקוניק, או דברו איתנו ישירות.

דברו איתנו ב-WhatsApp

ממשיכים מכאן

רוצים להפוך את הרעיונות מהכתבה למערכת שעובדת באמת?

STSICONIC בונה לעסקים פתרונות AI, אוטומציה, CRM ואתרים שעובדים בשטח, בעברית, ועם התאמה אמיתית לתהליך שלכם.

לכל השירותים שלנולחזור לבלוג

רוצים לדעת מה זה אומר אצלכם בעסק?

נמפה לכם את התהליך, בלי עלות ובלי התחייבות

נשב איתכם, נבין איך אתם עובדים היום, ונגיד לכם בכנות מה משתלם לכם לחבר ל-AI ומה לא. גם אם התשובה היא שלא צריך אותנו.

  • מיפוי התהליכים נעשה ללא עלות.
  • אנחנו בונים סביב איך שאתם עובדים, לא מכריחים אתכם להתאים את עצמכם למערכת.
  • מדברים איתכם בעברית, מהאפיון ועד אחרי ההשקה.

מעדיפים שנחזור אליכם? מלאו את הטופס.

אנו משתמשים בעוגיות לצורכי תפעול, אנליטיקה ושיווק. לפרטים ראו את מדיניות הפרטיות.
מדיניות פרטיות