דילוג לתוכן הראשי

מדריך: תמלול אודיו בעברית עם Gemini 3.5 Transcribe החדש

גוגל שחררה את Gemini 3.5 Transcribe ו-Transcribe Live ל-GA. כך תבנו תמלול מדויק בעברית עם זיהוי דוברים, חותמות זמן וסטרימינג חי, צעד אחר צעד.

איתי רוזןאיתי רוזןכתב מודלים וכלים
·4 דק׳ קריאה·1 צפיות
0:00 / 6:35
שולחן אולפן הקלטות עם מיקרופון מקצועי ומחשב נייד המציג גלי קול ותמלול מחולק לדוברים

גוגל הוציאה השבוע לזמינות כללית (GA) שני מודלי תמלול ייעודיים: Gemini 3.5 Transcribe לתמלול קבצי אודיו, ו-Gemini 3.5 Transcribe Live לתמלול סטרימינג בזמן אמת. לצד ההשקה פורסמו שני מדריכים רשמיים חדשים, ואנחנו מתרגמים אותם כאן לצעדים מעשיים: מהקמת הפרויקט ועד תמלול שיחה בעברית עם זיהוי דוברים וחותמות זמן ברמת המילה.

מה בדיוק השתחרר, ולמה זה שונה מתמלול רגיל

עד היום, מי שרצה תמלול איכותי דרך Gemini נאלץ להשתמש במודל כללי ולקוות לטוב. הפעם מדובר במודלים ייעודיים לתמלול: Gemini 3.5 Transcribe מזהה שפה אוטומטית מתוך יותר מ-85 שפות, כולל עברית, ומחזיר זיהוי דוברים (speaker diarization) וחותמות זמן ברמת מילה. הגרסה השנייה, Transcribe Live, עובדת בסטרימינג דו-כיווני מעל WebSockets, כלומר האודיו זורם למודל והטקסט חוזר תוך כדי דיבור.

ההבדל המעשי גדול: תמלול קבצים מתאים לפודקאסטים, ישיבות מוקלטות וארכיוני שיחות, בעוד שהמסלול החי פותח את הדלת לכתוביות בזמן אמת, סוכני קול ומרכזיות שירות שמנתחות שיחה בזמן שהיא מתרחשת.

צעד 1: תמלול קובץ אודיו עם זיהוי דוברים

נתחיל במקרה הנפוץ: יש לכם הקלטה של פגישה או ראיון, ואתם רוצים תמלול מסודר. אחרי יצירת מפתח API בקונסולת המפתחים של גוגל, הקוד נראה בערך כך:

from google import genai

client = genai.Client()

audio = client.files.upload(file="meeting.mp3")

response = client.models.generate_content(
    model="gemini-3.5-transcribe",
    contents=["תמלל את ההקלטה עם זיהוי דוברים וחותמות זמן", audio],
)

print(response.text)

המודל מזהה לבד שהשיחה בעברית, אין צורך להגדיר שפה מראש. הפלט כולל תיוג דוברים (Speaker 1, Speaker 2) וניתן לבקש בפרומפט פורמט ספציפי: SRT לכתוביות, JSON עם חותמות זמן לכל מילה, או סיכום תמצית לצד התמלול המלא.

לשיחות בעברית עם מונחים מקצועיים באנגלית, כדאי להוסיף לפרומפט רשימת מונחים צפויים (שמות מוצרים, ראשי תיבות). זה משפר משמעותית את הדיוק במעברי שפה, שהם נקודת התורפה הקלאסית של מערכות תמלול בישראל.

צעד 2: תמלול חי מעל WebSockets

המסלול השני, Gemini 3.5 Transcribe Live, בנוי לתרחישים שבהם הטקסט צריך להגיע תוך כדי דיבור. הארכיטקטורה פשוטה: פותחים חיבור WebSocket, דוחפים chunks של אודיו מהמיקרופון, ומקבלים בחזרה טקסט חלקי שמתעדכן ומתייצב ככל שהמשפט מתקדם.

מסך במרכז שירות לקוחות המציג תמלול חי של שיחה טלפונית לצד נציגה עם אוזניות
תמלול בזמן אמת הופך שיחות שירות לטקסט שאפשר לנתח, לתייג ולתעד בלי הקלדה ידנית

המדריך הרשמי של גוגל (Live transcription guide) מפרט את מבנה ההודעות: כל chunk אודיו נשלח כ-PCM גולמי או בפורמט דחוס, והתשובות חוזרות כאירועי טקסט עם דגל שמסמן אם התוצאה סופית או ביניים. הנקודות שחשוב לסגור נכון:

  1. דגימת אודיו: ודאו שקצב הדגימה במיקרופון תואם למה שהמודל מצפה לו, אחרת הדיוק צונח.
  2. טיפול בתוצאות ביניים: הציגו טקסט זמני באפור והחליפו אותו בטקסט הסופי, כמו שעושות אפליקציות כתוביות.
  3. ניתוקים: WebSocket נופל לפעמים ברשתות סלולריות, בנו לוגיקת reconnect ששומרת את ההקשר.
  4. השהיה (latency): שלחו chunks קצרים ותכופים במקום גדולים ונדירים כדי לקבל תגובה מהירה.

למה זה מעניין במיוחד משתמשים ועסקים בישראל

עברית הייתה שנים ילד חורג של מערכות תמלול. שילוב של עברית ואנגלית באותה שיחה, מונחים צבאיים וטכנולוגיים, ודוברים שמדברים אחד על השני, כל אלה שברו מערכות ותיקות. העובדה שגוגל כוללת עברית בין יותר מ-85 השפות הנתמכות עם זיהוי שפה אוטומטי משנה את התמונה לכמה תרחישים ישראליים מובהקים:

  • משרדי עורכי דין ורואי חשבון: תיעוד פגישות לקוח אוטומטי במקום סיכומים ידניים.
  • מוקדי שירות: ניתוח שיחות בעברית בזמן אמת לזיהוי לקוח כועס או הזדמנות מכירה.
  • יוצרי תוכן ופודקאסטרים: כתוביות והנגשה בעברית בלי לשלוח קבצים לתמלול ידני.
  • סטארטאפים בתחום ה-voice: תשתית מוכנה לסוכני קול דוברי עברית בלי לאמן מודל תמלול משלכם.
עד עכשיו כל פרויקט קול בעברית התחיל בכאב ראש של תמלול. כשספק הענן נותן את זה כ-API יציב עם זיהוי דוברים, אפשר סוף סוף להתמקד במוצר עצמו במקום בתשתית
מפתח בכיר בחברת SaaS ישראלית

מה הלאה: איך מתחילים היום

מכיוון שהמודלים כבר ב-GA ולא ב-Preview, אפשר לבנות עליהם מוצר ייצור בלי חשש משינויים שוברי תאימות בהתראה קצרה. ההמלצה שלנו: התחילו במסלול הקבצים, שהוא פשוט יותר, תמללו עשר הקלטות אמיתיות מהעסק שלכם ובדקו את הדיוק בעברית על התוכן שלכם דווקא. רק אחרי שיש לכם benchmark פנימי, עברו למסלול ה-Live אם התרחיש דורש זמן אמת.

שני המדריכים הרשמיים, Audio transcription guide ו-Live transcription guide, מכסים גם נושאים מתקדמים כמו פורמטי אודיו נתמכים ועבודה עם קבצים ארוכים. בשילוב עם דוגמת הקוד שלמעלה, המרחק בין הקלטה גולמית לתמלול עברי מסודר עם דוברים וחותמות זמן הוא פחות משעת עבודה.

לפני שמעבירים הקלטות של לקוחות לתמלול בענן, ודאו עמידה בדרישות הגנת הפרטיות בישראל: יידוע המשתתפים על ההקלטה והעיבוד, והגדרות retention מתאימות בצד גוגל. שיחות שירות נחשבות מידע אישי לכל דבר.

שאלות נפוצות

האם Gemini 3.5 Transcribe תומך בעברית?

כן. המודל מזהה שפה אוטומטית מתוך יותר מ-85 שפות, ועברית ביניהן. הוא מחזיר גם זיהוי דוברים וחותמות זמן ברמת מילה, כך שהוא מתאים לתמלול פגישות, פודקאסטים ושיחות שירות בעברית.

מה ההבדל בין Gemini 3.5 Transcribe ל-Transcribe Live?

Transcribe מיועד לתמלול קבצי אודיו מוקלטים, בעוד Transcribe Live עובד בסטרימינג דו-כיווני מעל WebSockets ומחזיר טקסט בזמן אמת תוך כדי דיבור. הראשון מתאים לארכיונים והקלטות, השני לכתוביות חיות וסוכני קול.

איך מתמללים שיחה עם כמה דוברים באמצעות Gemini?

שולחים את קובץ האודיו ל-Gemini 3.5 Transcribe ומבקשים בפרומפט זיהוי דוברים (speaker diarization). המודל מתייג כל קטע דיבור לפי דובר ומוסיף חותמות זמן, ואפשר לבקש פלט בפורמט SRT או JSON לפי הצורך.

#Gemini 3.5 Transcribe#גוגל#תמלול אוטומטי#זיהוי דוברים#WebSockets#סוכני קול
מה דעתכם?

דרגו את הכתבה

הדירוג עוזר לנו לדעת מה שווה לכם.

תגובות

התגובה חייבת להיות בעברית ומתפרסמת מיד.
  1. היו הראשונים להגיב.

עוד בנושא