Gemini TTS: הופכים כל טקסט לקול אנושי בעברית

חדש ב-Google AI Studio
כותבים בעברית, מקבלים קול
ב-Google AI Studio נפתח אולפן קול שמבוסס על Gemini 3.8 Flash TTS. כותבים שורה, בוחרים קול, ואחרי כמה שניות יש קריינות טבעית בעברית, כולל צחוק, הפסקות ודיאלוג של שני דוברים.
- קריינות עם הקולות המוכנים, בחינם
- עברית נתמכת רשמית
- דיאלוג של שני דוברים
- עיצוב קול מתיאור, בתשלום
Gemini 3.8 Flash TTS הוא מודל חדש של גוגל שהופך טקסט לדיבור. הוא הושק ב-23 בספטמבר 2026, יחד עם מסך חדש ב-Google AI Studio שבנוי כמו אולפן: תסריט, דוברים, הוראות בימוי וספריית קולות. יצירת דיבור הייתה ב-AI Studio גם קודם, עם דגמי ה-TTS של Gemini 2.5 ו-3.1. החדש הוא המודל עצמו, עיצוב קול מתיאור, שכפול קול וספרייה של יותר מ-2,000 קולות. לפי התיעוד של גוגל המודל תומך ב-130 שפות, ועברית ביניהן. בבדיקה כאן הוא הפיק קריינות בעברית מפרויקט במסלול החינמי, בלי לחבר מפתח בתשלום.
המדריך עובר על המסך צעד אחרי צעד, מהקריינות הראשונה ועד קול שמעוצב מתיאור במילים, ובסוף בונה ממנו ריל שלם. כל הדוגמאות נבנו סביב עסק בדוי אחד, פול פנימי, סטודיו לסדנאות קפה בתל אביב שהופיע כבר במדריך על ChatGPT Sites. ליד כל שלב מוטמע קובץ השמע שיצא בפועל, כדי שתוכלו לשמוע ולא רק לקרוא.
מה חינמי ומה בתשלום
במסלול החינמי
- קריינות מכל טקסט, עם 30 קולות סטודיו וספרייה של יותר מ-2,000 קולות
- סגנון בתיאור חופשי, או אחד מ-5 סגנונות מוכנים
- 40 תגיות ביטוי, כמו צחוק, אנחה והפסקה
- דיאלוג של שני דוברים
- השמעה והורדה של הקובץ
דרש מפתח API בתשלום
- עיצוב קול חדש מתיאור במילים
השמע עצמו עולה במסלול בתשלום 9 דולר למיליון טוקנים עד סוף 2026, וגוגל סופרת 25 טוקנים לכל שנייה: בערך 1.4 סנט לדקת קריינות. מ-1 בינואר 2027 המחיר כפול.
למסלול החינמי יש מגבלות קצב, ולפי דף המחירים גוגל משתמשת בתוכן שבו כדי לשפר את המוצרים שלה. על זה בהרחבה בפרק על פרטיות.
איך נבדקה העברית. כל קובץ תומלל בחזרה לטקסט בשני מודלים של Gemini, ובמקומות שבהם הם לא הסכימו זה כתוב במפורש. זו בדיקה אוטומטית, לא אוזן אנושית, ולכן כל הקבצים מוטמעים כאן להאזנה.
מה קורה כשלוחצים Run
המסך בנוי כמו תסריט. כל בלוק הוא שורה של דובר, ובתוך השורה אפשר לשלב תגיות שאומרות למודל איך לבצע אותה. בלחיצה על Run המודל מבצע את כל התסריט בקובץ שמע אחד: הדוברים מדברים בתורות, והתגיות נשמעות במקום שבו נכתבו. גוגל מתעדת שכל קובץ מקבל סימן מים בלתי נשמע, SynthID.
- 1תסריט: שורות, דוברים ותגית.
- 2ביצוע: שני קולות בתורות, והצחוק נשמע בדיוק במקום התגית.
- 3קובץ WAV, עם סימן מים SynthID.
1פותחים את אולפן הקול
נכנסים ל-aistudio.google.com/generate-speech עם חשבון Google. המסך נפתח עם דוגמאות מוכנות וגלריית קולות. בשורה הראשונה נמצא Create new dialog, לקריינות ולדיאלוג, ובשורה השנייה Create new voice, לעיצוב קול. בחלונית שבצד מופיע המודל שנבחר, Gemini 3.8 Flash TTS.

בראש המסך מופיע כפתור No API key selected. הוא מוביל לחיבור מפתח בתשלום, ולקריינות עם הקולות המוכנים אין בו צורך: בבדיקה, בפרויקט חדש במסלול החינמי, הקריינות נוצרה בלי לגעת בו.
2קריינות ראשונה בעברית
Create new dialog פותח בלוק דיבור אחד. כותבים או מדביקים טקסט, לוחצים Run, ואחרי כמה שניות מופיע בתחתית המסך נגן עם כפתור הורדה. זה הטקסט שנכתב לריל של פול פנימי, בלי שום הגדרה נוספת:
ביום שישי הקרוב, סדנת לאטה ארט למתחילים בפול פנימי. שעתיים ליד מכונת האספרסו, עם בריסטה שמראה כל תנועה, ויוצאים הביתה עם הלב הראשון שציירתם בחלב. יש 12 מקומות בלבד.

התמלול החוזר יצא זהה לטקסט, מילה במילה. מה שכן השתבש הוא המספר 12, ועל זה בפרק על עברית.
העורך מציג עברית מיושרת לשמאל, ולכן סימני הפיסוק נראים במקום הלא נכון. זו רק התצוגה: הקריינות יצאה בסדר הנכון, ואין צורך לתקן שום דבר ידנית.
3בוחרים קול
לחיצה על שם הדובר, Speaker 1 - Fola, פותחת את חלונית הקולות: חיפוש בין יותר מ-2,000 קולות, סינון לפי שפה, מבטא, מגדר, גובה, סגנון ושימוש, ו-10 קטגוריות, כמו קריינות פרסומית, פודקאסט, מספרי סיפורים ומוקד שירות. ליד כל קול יש כפתור שמשמיע דוגמה.


זה לא אומר שאין קולות לעברית. כל ארבעת הקולות שנבדקו כאן, Fola, Nika, Rami וקול שעוצב במיוחד, דיברו עברית. בוחרים קול לפי האופי שלו, לא לפי השפה. לריל נבחרה Nika, מקטגוריית הקריינות הפרסומית, ובשלב הבא היא מקבלת גם סגנון.
4מכוונים את הביצוע: סגנון ותגיות
יש שתי דרכים לשלוט באיך שהטקסט נאמר. הראשונה היא Style: שדה חופשי שבו מתארים את הטון, או 5 סגנונות מוכנים, Whisper, Friendly, Narration, Promote ו-Podcast. אפשר לתאר בעברית. זה התיאור שקיבלה Nika:
נלהב וחם, כמו פרסומת קצרה לאינסטגרם, עם חיוך בקול

הדרך השנייה היא תגיות בתוך הטקסט. הכפתור + Expression פותח שורה של 40 תגיות, ואפשר גם לכתוב אותן ישירות בתוך המשפט, בסוגריים משולשים:
ואם הלב יצא קצת עקום <laugh> זה בדיוק מה שקרה לכולם בפעם הראשונה.

40 התגיות, לפי סוג
בממשק הן מופיעות ברשימה אחת. החלוקה כאן נועדה רק להקל על החיפוש.
מה נבדק ומה לא. התגית laugh עבדה בשתי ההרצות שבהן שולבה. gasp, בדיאלוג שבשלב הבא, לא נשמעה בבירור: מודל תמלול אחד לא זיהה שום צליל, והשני זיהה צחוק. שאר התגיות לא נבדקו כאן. גוגל מתעדת גם תגובות של מאזין שנכתבות בין קווים אנכיים בתוך התור של הדובר, כמו |oh hmm| או |absolutely|, שגם הן לא נבדקו. תגית היא בקשה מהמודל, לא התחייבות, ולכן מקשיבים לכל טייק.
5דיאלוג של שני דוברים
Add speech block מוסיף בלוק, והוא עובר אוטומטית לדובר הבא. כל דובר מקבל קול משלו מהחלונית שבצד. בדוגמה, Rami מקטגוריית הפודקאסט הוא המדריך בסדנה, ו-Fola היא משתתפת:
דובר 1אז מה, מוכנה לשפוך את הלב הראשון שלך?
דובר 2<gasp> רגע, כבר עכשיו? עוד לא הבנתי איך מחזיקים את הכוס.
דובר 1<laugh> זה כל הסוד. מטים קצת, שופכים לאט, ובסוף מושכים קו אחד באמצע.
דובר 2וואו. זה באמת נראה כמו לב.

מילות מילוי: שיחה אנושית יותר, אבל לא לפי התסריט
כשיש שני דוברים מופיע המתג Filler words. אותו תסריט הורץ שוב אחרי שהמתג הופעל, והמודל הוסיף מילים שלא נכתבו:
דובר 1אז מה, מוכנה לשפוך את הלב הראשון שלך?
דובר 2רגע, כבר עכשיו? עוד לא הבנתי איך מחזיקים את הכוס.
דובר 1(צחוק) זה... זה כל הסוד. מטים קצת,
דובר 2אוקיי,
דובר 1שופכים לאט, ובסוף מושכים קו אחד באמצע.
דובר 2וואו, זה אשכרה באמת נראה כמו לב.
שני מודלי התמלול הסכימו על שלוש התוספות: החזרה "זה... זה", ה"אוקיי" של המשתתפת באמצע המשפט של המדריך, והמילה "אשכרה". זה נשמע כמו שיחה אמיתית, אבל הטקסט כבר לא מה שכתבתם. לפרסומת, לנוסח משפטי ולכל טקסט שחייב להישמע בדיוק כמו שנכתב, משאירים את המתג כבוי.
6עיצוב קול מתיאור, במסלול בתשלום
לוחצים Create new voice ובוחרים Voice Design. כאן מופיע החסם: Voice Design runs on the paid tier. צריך לחבר מפתח API מפרויקט שהחיוב בו פעיל. בבדיקה חובר מפתח קיים, בלי האפשרות לשמור אותו לפעמים הבאות.

אחרי החיבור נפתח טופס: שם לקול ותיאור חופשי. גוגל מבקשת לפרט גוון, גיל, מגדר, גובה, קצב, מבטא, טון והרגלי דיבור, וכותבת שככל שהתיאור מפורט יותר, התוצאה טובה יותר. התיאור נכתב בעברית:
קול של בריסטה בשנות ה-30 לחייה, חם וחייכני, עברית ישראלית טבעית בקצב רגוע, כאילו היא מקבלת אתכם בכניסה לבית קפה בבוקר.

Generate voice מייצר 3 גרסאות, ובבדיקה זה לקח כ-20 שניות. כל גרסה מקריאה משפט דוגמה שהמודל כתב בעצמו, בעברית ובאופי שתואר. בוחרים גרסה, לוחצים Continue ואז Use voice, והקול מופיע כדובר, מסומן Custom.

בשתיים מתוך שלוש הגרסאות המילה האחרונה יצאה משובשת, לפי ניתוח אוטומטי. מקשיבים לשלוש לפני שבוחרים, ואם אף אחת לא מתאימה לוחצים Regenerate.


ובקול הזה, הודעת המענה הקולי של הסטודיו. השם כבר מנוקד כאן, מסיבה שמוסברת בפרק על עברית:
הגעתם לְפּוֹל פְּנִימִי, סטודיו לסדנאות קפה בתל אביב. כרגע כולם ליד המכונה, אז השאירו שם ומספר טלפון, ונחזור אליכם עוד היום.
לפי התיעוד, כל פרויקט שומר עד 200 קולות, וקול שנשמר נשאר שנה.
7שכפול קול: מה המסך מבקש
Voice Replication יוצר קול מהקלטה. המסך מבקש כ-20 שניות של דיבור טבעי, "סיפור, לא מונוטוני", ואחר כך הקלטה נוספת שבה בעל הקול מקריא משפט הסכמה. בתיעוד גוגל מדברת על דגימה של 10 עד 30 שניות, ומפרטת את משפט ההסכמה ב-30 גרסאות שפה, בלי עברית. המסך ב-AI Studio הציג אותו באנגלית.

עברית בלי הפתעות
בכל הקבצים במדריך התמלול החוזר תאם לטקסט. ובכל זאת, יש כמה דברים שכדאי להכיר לפני שמקליטים משהו חשוב.
מספרים: במילים, כשהמין חשוב
"12 מקומות" נקרא "שתים עשרה מקומות", בלשון נקבה, ב-3 מתוך 5 הרצות. כשהמספר נכתב במילים, "שנים עשר מקומות", הוא נקרא נכון. שעות ומחירים יצאו טבעי: "10:30" נקרא "עשר וחצי", ו"180 שקלים" נקרא "מאה שמונים שקלים".
שמות ומילים דו-משמעיות: ניקוד רק במקום שצריך
השם פול פנימי נקרא "בפוּל", כמו התבשיל, בקול של Fola, ו"בפּוֹל" בקול של Nika. בלי ניקוד המודל מנחש, ובמשפט דו-משמעי במיוחד, "הספר ספר את הספרים", שני מודלי התמלול שמעו דברים שונים ואף אחד מהם לא שמע את המשפט. הפתרון הוא לנקד רק את המילה הבעייתית, בעזרת אתר ניקוד כמו nakdan.com:
- מדביקים באתר את המשפט ולוחצים "נקד הכל".
- בודקים את המילה הבעייתית. אם הניקוד לא מתאים, שמים את הסמן בתוך המילה ולוחצים "תקן מילה": נפתחת רשימת חלופות, ומתחתיה עורך שמנקד אות אחרי אות. כאן נוסף דגש לפ' כדי לקבל "בְּפּוֹל".
- מעתיקים רק את המילה המנוקדת אל הטקסט ב-AI Studio ומריצים שוב.

עם הניקוד, הפ' נקראה נכון בשתי ההרצות, והתנועה נקראה נכון באחת מהן. בשנייה יצא "בפּוּל". הניקוד מעלה את הסיכוי, ואת השאר משלימה הבחירה בין טייקים.
לא מנקדים את כל הטקסט. בבדיקה, "נקד הכל" הפך את "לאטה" ל"לְאִטָּהּ", ובמשפט "הספר ספר את הספרים" ניקד את המילה הראשונה כ"סֵפֶר" ולא כ"סַפָּר". ניקוד שגוי יכול לשבש מילה שהמודל קרא נכון בלעדיו.
כל Run הוא טייק חדש
אותו טקסט לא יוצא זהה פעמיים. המספר 12 נקרא פעם נכון ופעם לא, והניקוד עבד פעם במלואו ופעם בחלקו. לקריינות שחשובה לכם מריצים 2-3 פעמים ובוחרים את הטובה.
מהקריינות לריל שלם, עם Flow
קריינות היא חצי מסרטון. הריל שבראש העמוד נבנה כך:
- קריינות סופית ב-AI Studio, עם Nika, עם הסגנון בעברית ועם שני התיקונים מהפרק הקודם: "בְּפּוֹל פְּנִימִי" מנוקד, ו"שנים עשר" במילים. התמלול החוזר אישר את שניהם.
- שני קליפים של 8 שניות ב-Google Flow, בפורמט אנכי 9:16, מבקשות בעברית לסוכן של Flow.
- חיבור לסרטון אחד: הקליפים, הקריינות וכותרת בסוף. כל עורך וידאו שמאפשר להוסיף שכבת שמע מתאים לשלב הזה.
צור סרטון אנכי: צילום תקריב קולנועי של ידיים של בריסטה שופכות חלב מוקצף לתוך כוס אספרסו ויוצרות ציור של לב בקפה, בסטודיו קפה קטן ומואר באור בוקר חמים, דלפק עץ ורקע מטושטש. תנועת מצלמה איטית. בלי טקסט, בלי שלטים ובלי לוגו.


לפני כל סרטון Flow הציג את העלות, 100 קרדיטים, וחיכה לאישור. בשני הקליפים הניסיון הראשון נכשל עם הודעה על מכסה יומית, בלי חיוב, והכפתור לניסיון חוזר על הקליף עבד. בהגדרות אפשר לבחור "אף פעם", ואז הסוכן מייצר בלי לעצור לאישור.
הווידאו נוצר ב-AI, והדמויות בו לא אמיתיות. גם העסק בדוי.
איפה עוד המודל הזה עובד
לפי גוגל, Gemini 3.8 Flash TTS זמין לכל המשתמשים גם ב-Gemini Notebook, שנקרא בעבר NotebookLM (על שינוי השם יש באתר עדכון נפרד), והגרסה הקלה, Flash-Lite TTS, מגיעה ל-Google Vids. מפתחים מקבלים את שניהם ב-Gemini API. שני המוצרים האלה לא נבדקו כאן. למי שמשווה בין כלים, יש באתר גם מדריך מלא על ElevenLabs v3.
סימן מים, פרטיות וקולות של אחרים
- SynthID. גוגל מתעדת שכל קטע שמע שהמודלים האלה מפיקים מסומן בסימן מים בלתי נשמע, כדי שאפשר יהיה לזהות אותו כתוצר AI. יש באתר מדריך מלא על SynthID.
- מה קורה לטקסטים. בדף המחירים גוגל כותבת שבמסלול החינמי התוכן משמש לשיפור המוצרים שלה, ובמסלול בתשלום לא. חומר רגיש לא מעלים למסלול החינמי.
- קולות של אחרים. שכפול קול דורש הקלטת הסכמה של בעל הקול. בלי הסכמה, לא משכפלים.
- שימוש מסחרי. התנאים המלאים נמצאים בתנאי השימוש של Gemini API.
שאלות נפוצות
האם Gemini TTS קורא עברית?
כן. לפי התיעוד של גוגל, עברית היא אחת מ-130 השפות של Gemini 3.8 Flash TTS. בבדיקה כאן כל הקבצים בעברית תומללו בחזרה לטקסט זהה, מילה במילה.
זה באמת חינם?
קריינות עם הקולות המוכנים, סגנונות, תגיות ודיאלוג עבדו בפרויקט במסלול החינמי, בלי מפתח בתשלום. עיצוב קול מתיאור דרש מפתח בתשלום. במסלול החינמי יש מגבלות קצב, וגוגל כותבת שהתוכן בו משמש לשיפור המוצרים שלה.
כמה עולה השמע במסלול בתשלום?
9 דולר למיליון טוקנים של שמע עד סוף 2026, כשכל שנייה נספרת כ-25 טוקנים. זה בערך 1.4 סנט לדקת קריינות. מ-1 בינואר 2027 המחיר כפול. בדף המחירים אין שורה נפרדת ליצירת קול.
למה המספרים נקראים לא נכון?
ספרות נקראו לפעמים בלשון הלא נכונה: "12 מקומות" נקרא "שתים עשרה מקומות" ב-3 מתוך 5 הרצות. כשהמין חשוב, כותבים את המספר במילים.
איך גורמים לשם של עסק להישמע נכון?
מנקדים רק את השם, למשל באתר nakdan.com, ומעתיקים את המילה המנוקדת לטקסט. אם הניקוד האוטומטי לא מתאים, בוחרים ניקוד אחר עם "תקן מילה". מריצים כמה טייקים ובוחרים.
המודל הוסיף מילים שלא היו בטקסט. למה?
כנראה שהמתג Filler words פעיל. הוא מופיע בדיאלוג של שני דוברים ומוסיף מילות מילוי ותגובות, כמו "אוקיי". לטקסט שחייב להישאר מדויק משאירים אותו כבוי.
אפשר לשכפל את הקול שלי?
Voice Replication מבקש דגימה של כ-20 שניות ואחריה משפט הסכמה של בעל הקול. לפי התיעוד, משפט ההסכמה קיים ב-30 גרסאות שפה, ועברית לא ביניהן.
המקורות הרשמיים
הבדיקה בוצעה ב-24 בספטמבר 2026, והתיעוד נבדק שוב באותו יום.
- Google: ההכרזה על Gemini 3.8 Flash TTS ו-Flash-Lite TTS
- Gemini API: יצירת דיבור ורשימת השפות הנתמכות
- Gemini API: עיצוב קול · שכפול קול, אורך הדגימה ומשפטי ההסכמה
- Gemini API: מחירים ומה נעשה בתוכן בכל מסלול · מגבלות קצב · תנאי שימוש
- Google DeepMind: SynthID · כרטיס המודל של Gemini 3.8 Audio
- Google AI Studio: אולפן הקול · Google Flow · nakdan.com
הירשמו לעדכונים במייל
רוצים להישאר צעד אחד קדימה?
עדכונים על כלי AI, מדריכים וטיפים - ישר למייל. בלי ספאם.
