קול AI בעברית: הכתבה, קריינות ושכפול קול
מה באמת עובד בעברית, מה רק נראה שעובד, ואיך בודקים לבד. כולל מדידה שעשינו בעצמנו.
בעברית כמעט הכל עובד — חוץ מדבר אחד. ההכתבה מצוינת וחינמית, והקריינות בענן מעולה: מדדנו בעצמנו 4% שגיאות מילים ב-Gemini וב-ElevenLabs v3. מה שעדיין נשבר הוא שכפול קול חינמי-מקומי — ב-Voicebox קיבלנו 65% שגיאות. הכלל: לקריינות בחרו מודל ענן, לא כלי שכפול מקומי.
מאת הנרי שטאובר · מומחה AI ומרצה · עודכן: 2026-07-14 · פורסם: 2026-07-14
מבוא: למה כל מדריך אחר יטעה אתכם
כמעט כל תוכן שתמצאו על כלי קול AI מעתיק את מה שכתוב באתר של היצרן. היצרן כותב "תומך בעברית", וזהו.
אנחנו עשינו משהו אחר: התקנו, הרצנו, מדדנו. התוצאה מפתיעה ומחלקת את העולם לשניים.
השורה התחתונה, לפני הכל
ההכתבה בעברית עובדת. הקריינות ושכפול הקול — עדיין לא.
זה נשמע כמו פרט קטן, אבל זה ההבדל בין כלי שיחסוך לכם שעות לבין כלי שיבזבז לכם ערב שלם.
רוב הכלים מוכרים לכם את שניהם באותה נשימה, ומסתירים את ההבדל.
שלוש יכולות שכולם מבלבלים ביניהן
"קול AI" הוא לא דבר אחד. אלה שלושה דברים נפרדים, ובעברית הם מצליחים ונכשלים בצורה שונה לגמרי:
- הכתבה ותמלול (דיבור לטקסט). אתם מדברים, המחשב כותב. בעברית: עובד מצוין, גם בחינם.
- קריינות (טקסט לדיבור). אתם כותבים, המחשב מקריא. בעברית: מעולה — בכלים בענן. מדדנו 4% שגיאות ב-Gemini וב-ElevenLabs v3.
- שכפול קול (המחשב מדבר בקול שלכם). כאן הבעיה: בכלים חינמיים-מקומיים זה עדיין נשבר. מדדנו 65% שגיאות.
כשמישהו אומר "הכלי הזה תומך בעברית" — תשאלו: באיזו מהשלוש? התשובה שונה לגמרי.
למה דווקא עברית קשה למחשב
לפני שנוגעים בכלי אחד, כדאי להבין למה עברית היא מקרה קשה. זה יסביר כמעט כל תקלה שתפגשו.
שלוש סיבות מבניות
1. אין ניקוד. בעברית מודרנית כמעט לא מנקדים, אבל הניקוד הוא זה שקובע איך להגות מילה. המחשב נאלץ לנחש מההקשר.
2. גם ניקוד לא מספיק — ההטעמה לא מסומנת בכלל. "אורז" יכול להיות אוֹרֶז (הדגן) או אוֹרֵז (אורז מזוודה). אותו כתיב, אותו ניקוד. רק ההטעמה מבדילה.
3. יש פשוט מעט חומר. מודל Whisper של OpenAI אומן על 680,000 שעות. לעברית הוקצו מהן 688 שעות בלבד — פחות מאחוז אחד.
המספר שמסביר הכל
OpenAI פרסמו את שיעור שגיאת המילים של Whisper בעברית, לפי גודל המודל:
| גודל | שגיאות בעברית |
|---|---|
| tiny | 71.6% |
| base | 61.7% |
| small | 44.4% |
| medium | 33.1% |
| large | 30.2% |
ב-tiny כמעט 3 מכל 4 מילים שגויות. זו לא תחושה — זה המספר של OpenAI עצמם.
המסקנה המעשית: בעברית, מודל קטן אינו "קצת פחות טוב". הוא חסר תועלת.
החוק הראשון של קול בעברית
אם כלי נותן לכם לבחור גודל מודל — תמיד בחרו את הגדול ביותר שהמחשב שלכם סוחב. בשפות אחרות ההבדל הוא ניואנס. בעברית זה ההבדל בין עובד ללא עובד.
נוף הכלים: מי עושה מה
שמונה כלים, שלוש משפחות. לא כולם מתחרים זה בזה — רובם עושים דברים שונים לגמרי.
המפה, בשלוש שורות
להכתבה ותמלול: הכתבה בעברית · ivrit.ai · Gladia · kolwrite
לקריינות: ElevenLabs · openai.fm · Cartesia
לשכפול קול מקומי: Voicebox
כלי אחד שעושה הכל בדרך כלל עושה את רובו בינוני. תבחרו לפי המשימה.
איך לקרוא את הכרטיסים
לכל כלי כתבנו מה הוא עושה שהאחרים לא — ולא רשימת פיצ'רים.
שימו לב במיוחד לשורת התמחור: כמה כלים שנראים חינמיים אינם מתירים שימוש מסחרי בשכבה החינמית. סרטון עם מונטיזציה נחשב שימוש מסחרי.
הכתבה בעברית
אפליקציית הכתבה חינמית לוינדוס ומאק: Alt+D מפעיל הכתבה בכל תוכנה — וורד, ג'ימייל, ווטסאפ. הייחוד שלה הוא שהיא נותנת לבחור ספק: Deepgram Nova-3, Groq, או מודל ivrit.ai מקומי לפרטיות מלאה. גילוי נאות: זו האפליקציה שהנרי בנה, והיא בקוד פתוח.
ivrit.ai
מיזם ישראלי ללא מטרות רווח שבנה את מאגר האודיו העברי הגדול בעולם — מעל 22,000 שעות — ואימן עליו מודלי תמלול פתוחים וחינמיים. זה המודל היחיד ברשימה שאומן ספציפית על עברית, ולא על אנגלית עם עברית בשוליים.
ElevenLabs
האפשרות המסחרית הבשלה ביותר לקריינות בעברית: היא נתמכת רשמית, בניגוד לרוב המתחרים שרק מצהירים על כך. שימו לב לפרט שמפיל אנשים: עברית קיימת רק במודל v3, ולא במודל הרב-לשוני הישן שרוב המדריכים עדיין מפנים אליו.
Voicebox
אולפן קול שלם שרץ לגמרי על המחשב שלכם, בחינם ובקוד פתוח, בלי חשבון ובלי מנוי — הקול והטקסטים לא עוזבים את המחשב. מצוין לאנגלית ולהכתבה. לקריינות בעברית, כפי שנראה בהמשך, הוא עדיין לא שם.
openai.fm
הדרך המהירה ביותר לשמוע קריינות עברית בלי להירשם לשום דבר: נכנסים לאתר, מדביקים טקסט, לוחצים. חינמי לגמרי. המחיר הוא שהקולות מכוונים לאנגלית — OpenAI כותבים את זה בעצמם בתיעוד.
Gladia
שירות תמלול שמכוון לעסקים, עם 10 שעות חינם בחודש — הרבה יותר ממה שנותנים המתחרים. טוען לתמיכה עברית מובנית במודל Solaria-1, אבל לא פרסם שום בדיקה שאפשר לשחזר, אז קחו את המספרים שלו בערבון מוגבל.
kolwrite
כלי תמלול ישראלי שבנוי במיוחד לעברית ולערבוב עברית-אנגלית, עם ממשק בעברית שלא מרגיש כמו תרגום. הצד הפחות נעים: המסלול החינמי הצטמצם ל-30 דקות בחודש עם פרסומות.
Cartesia
קריינות מהירה במיוחד, שנבנתה לשיחות בזמן אמת ולא לסרטונים — לכן היא מעניינת בעיקר למי שבונה בוט קולי. עברית נתמכת רשמית, אבל שכפול קול ורישיון מסחרי דורשים מסלול בתשלום.
טבלת ההשוואה
הטבלה בנויה על יכולות שמכריעות בפועל, לא על מה שכתוב בעמוד השיווקי.
5 כלים על 7 יכולות שמכריעות
| יכולת | הכתבה בעברית | ivrit.ai | Voicebox | ElevenLabs | openai.fm |
|---|---|---|---|---|---|
| הכתבה ותמלול בעברית | מצוין | מצוין (הכי מדויק בפתוחים) | טוב, רק במודל turbo | לא רלוונטי | לא רלוונטי |
| קריינות בעברית | לא רלוונטי | לא רלוונטי | חלש (65% שגיאות במדידה שלנו) | מצוין — 4% שגיאות במדידה שלנו (v3) | טוב — 11% שגיאות במדידה שלנו |
| שכפול קול בעברית | לא רלוונטי | לא רלוונטי | נכשל בפועל | כן, ממסלול בתשלום | לא |
| רץ מקומית (הקול לא עוזב את המחשב) | כן, במצב ivrit.ai מקומי | כן | כן, תמיד | לא — ענן | לא — ענן |
| חינם לשימוש מסחרי | כן | כן | כן | לא — מ-6 דולר בחודש | לא אומת |
| דורש כרטיס מסך חזק | לא | עדיף | לקריינות: כן. בלי כרטיס NVIDIA זה כואב | לא — רץ בענן | לא — רץ בענן |
| עלות להתחיל | 0 | 0 | 0 | 0 לניסיון, 6 דולר לשימוש אמיתי | 0 |
נכון ל-14 ביולי 2026. "65% שגיאות" הוא מדידה שביצענו בעצמנו — הפרטים בפרק שכפול הקול. "לא אומת" נכתב במקום ניחוש.
איך לקרוא את הטבלה
שימו לב לעמודה הכי חשובה: רץ מקומית.
אם אתם מתמללים פגישות לקוחות, חומר רפואי או משפטי — זו לא שורה טכנית. זו השורה שקובעת אם הקול של הלקוח שלכם נשלח לשרת של חברה זרה או נשאר אצלכם במחשב.
הכתבה קולית: הדבר שכן עובד
זה הפרק שישנה לכם את היום-יום. הכתבה בעברית הגיעה לרמה שבה אפשר להפסיק להקליד — והיא חינמית.
מה זה "מקש חם גלובלי" ולמה זה משנה
האפליקציה יושבת ברקע ומקשיבה לצירוף מקשים בכל תוכנה — לא רק בעורך אחד.
לוחצים, מדברים, והטקסט נדחף אוטומטית לאן שהסמן נמצא: מייל, וורד, ווטסאפ, טופס באתר.
שתי שיטות הפעלה:
- החזקה (push-to-talk) — מחזיקים את המקש כל עוד מדברים. טוב למשפט קצר, ואין סיכון שתשכחו שהמיקרופון פתוח.
- מתג (toggle) — לחיצה פותחת, לחיצה סוגרת. טוב לפסקה ארוכה.
שתי מלכודות שיעלו לכם ערב
1. ההכתבה המובנית של וינדוס (Win+H) לא תומכת בעברית. עברית פשוט לא ברשימת השפות של מיקרוסופט. אל תבזבזו זמן.
2. ב-Voicebox — כבו את auto-refine. הפיצ'ר שאמור "לנקות" את הטקסט מתרגם בשקט תמלול עברי לאנגלית. זה באג פתוח בפרויקט (Issue 603), והוא עדיין שם.

מה באמת חינמי בעברית
אלה האפשרויות שבדקנו שהן חינמיות באמת, בלי כוכביות:
- מודלי ivrit.ai — חינם, קוד פתוח, ואפשר להריץ מקומית בלי אינטרנט.
- Groq — שכבה חינמית אמיתית: עד 8 שעות אודיו ביום.
- הקלדה קולית של Google Docs — חינם, תומך עברית, בדפדפן.
ושלוש שאינן חינמיות באמת, למרות מה שנדמה: Deepgram (רק קרדיט חד-פעמי), Gladia (10 שעות בחודש), kolwrite (30 דקות בחודש).
המילים באנגלית והמספרים הם המבחן האמיתי. שם משותף לכל הכשלים בעברית הוא בדיוק שם.
תרגיל: פתחו את אפליקציית ההכתבה, כוונו אותה לעברית, ובחרו את המודל הגדול ביותר שיש. עכשיו הכתיבו את הפסקה הבאה בקול, בלי לתקן תוך כדי: "שלום, קוראים לי [השם שלכם]. אני בודק עכשיו כמה טוב הכלי הזה מתמלל עברית, כולל מילים באנגלית כמו ChatGPT ו-Gemini, וגם מספרים כמו 2026 ו-15 אחוז." עכשיו ספרו: כמה מילים יצאו שגויות? זו נקודת הייחוס שלכם. חזרו על אותו תרגיל בדיוק עם מודל קטן יותר, והשוו.
קריינות בעברית: הבעיה היא הניקוד
כאן דווקא יש חדשות טובות: קריינות בעברית בענן עובדת מצוין. מדדנו בעצמנו, והמספרים למטה. הפרק הזה הוא על איך להוציא ממנה את המקסימום — ועל טכניקה אחת שכמעט אף אחד לא מכיר.
מדדנו: איזה מודל באמת קורא עברית
לקחנו שלושה משפטים, ייצרנו כל אחד בכל מודל, ותמללנו את הפלט חזרה כדי לספור שגיאות. ככל שנמוך יותר — טוב יותר:
| מודל | שגיאות | חינם? |
|---|---|---|
| Gemini TTS | 4% | כן |
| ElevenLabs v3 | 4% | לא (מ-6 דולר) |
| OpenAI (openai.fm) | 11% | כן |
| ElevenLabs מודל ישן (v2) | 97% | — |
שתי מסקנות: Gemini נותן איכות מעולה בחינם, והמודל הישן של ElevenLabs לא באמת יודע עברית — לכן חובה לבחור דווקא v3.
Gemini TTS
ההפתעה של המדידה: מנוע הקריינות של גוגל נתן 4% שגיאות בעברית — ברמה של ElevenLabs, אבל בחינם דרך Google AI Studio. אם אתם כבר בתוך המערכת של גוגל, זו נקודת הפתיחה הכי חכמה לקריינות עברית.
למה לפעמים הקריינות עדיין נשמעת שגויה
המודל מקבל טקסט בלי ניקוד, ואמור להחליט לבד איך להגות כל מילה. לרוב הוא מנחש נכון. לפעמים הוא מנחש הפוך, והמשפט נשמע מגוחך.
וגם כשמנקדים — ההטעמה עדיין לא מסומנת. "אורז" מנוקד יכול עדיין להיות הדגן או פועל. רק ההטעמה מבדילה, ואין דרך לכתוב אותה.
הטריק: לנקד לפני שמקריאים
נקדו את הטקסט לפני שאתם מכניסים אותו לכלי הקריינות.
הנקדן החינמי של דיקטה (nakdanpro.dicta.org.il) עושה את זה בשנייה. אתם מדביקים טקסט, מקבלים אותו מנוקד, ואת זה מכניסים לכלי.
רוב הכלים מכבדים ניקוד כשהוא קיים. זו ההשקעה הכי משתלמת בכל התהליך.
שתי טעויות שמפילות קריינות עברית
1. מספרים כספרות. ElevenLabs מזהירים רשמית שספרות וסימנים "עלולים לגרום להגייה שגויה או להזיות קול". בעברית זה חמור יותר, כי למספר יש מין דקדוקי — שתי דקות מול שני ימים. כתבו מספרים במילים.
2. מודל ישן ב-ElevenLabs. עברית נתמכת רשמית רק ב-v3. המודל הרב-לשוני הישן (multilingual v2) לא כולל עברית ברשימה — ומי שמייצר בו עברית עובד מחוץ לתמיכה.
לרמה הבאה: Phonikud
אם אתם רציניים לגבי קריינות עברית, יש כלי קוד-פתוח חינמי שנבנה בדיוק לבעיה הזו.
Phonikud מוסיף מעל הניקוד את מה שחסר — סימוני הטעמה ושווא נע — וממיר את הטקסט לפונמות, כלומר לצלילים ממש ולא לאותיות.
הוא רץ מקומית, בחינם. זה הפתרון הכי קרוב שקיים היום לבעיית ההגייה בעברית.
שכפול קול: מדדנו, והנה האמת
זה הפרק שבגללו בנינו את הקורס. כל האינטרנט מספר שאפשר לשכפל את הקול שלכם בעברית בחינם. בדקנו.
איך שכפול קול עובד, בלי מונחים
המודל לא לומד את הקול שלכם ולא עובר אימון. זו נקודה שמבלבלת אנשים.
הוא מקבל קטע קול קצר, מחלץ ממנו מין "טביעת אצבע" — הצליל, הגובה, הקצב, המבטא — ומייצר משפט חדש תוך חיקוי אותה טביעה. הכל בזמן אמת.
לכן מספיקות 10 עד 30 שניות הקלטה. ולכן גם — הוא מחקה הכל, כולל מה שלא רציתם.
הוא משכפל גם את המזגן
מהתיעוד של ElevenLabs, מילה במילה: המודל מחקה "את המהירות, ההטיות, המבטא, הטון, דפוס הנשימה, וגם רעש ונקישות פה".
הקלטתם עם מזגן ברקע? המזגן ישוכפל לתוך כל קריינות עתידית.
המדידה שלנו: מה עשינו בדיוק
התקנו את Voicebox על מחשב וינדוס רגיל, בלי כרטיס מסך של NVIDIA.
שכפלנו את הקול של הנרי מהקלטה אמיתית שלו, ביקשנו ממנו להקריא שלושה משפטים בעברית, ואז תמללנו את הפלט חזרה והשווינו מילה במילה למקור.
כדי לוודא שהמתמלל אינו האשם, הרצנו בקרה: אותו מתמלל על ההקלטה האמיתית של הנרי. הוא זיהה אותה כמעט מושלם, בביטחון 0.99.
התוצאה: 65% מהמילים יצאו שגויות
| מה הוזן | מה יצא בפועל |
|---|---|
| היום אני מראה לכם כלי חדש | האם הוא נאמר לכם קלי חדש |
| הכלי נקרא Voicebox | חלי נקה וויס בוקס |
| תוכלו לשכפל את הקול שלכם | תוכלו לשפלת הקול שלכם |
המשפט שהכיל שם כלי באנגלית קרס כמעט לגמרי: 89% שגיאות.
זה לא "מבטא קצת מוזר". זה טקסט שאי אפשר להשתמש בו.
ואנחנו לא היחידים
אחרי המדידה חיפשנו אם מישהו אחר דיווח על זה. מצאנו:
- משתמש ישראלי, מרץ 2026, בדיוק באותו פרויקט: "בדקתי את Chatterbox בעברית וזה גרוע מאוד, בערך 70 עד 80 אחוז הגייה שגויה". המפתח לא הגיב. הדיון נסגר.
- משתמש טורקי, יולי 2026: אותה תלונה בדיוק, במילים אחרות — "הדיבור נשמע מותאם לאנגלית ולא טורקי".
- בקוד עצמו: מנגנון הניקוד האוטומטי לעברית הושמט מהמימוש. המפתח כתב לידו: "עברית עובדת בסדר גם בלעדיו".
שלוש עדויות בלתי תלויות, אותה מסקנה.
אז מה עם ה-0.93% שהיצרן מפרסם?
היצרן (Resemble AI) באמת מפרסם שיעור שגיאה של 0.93% לעברית. איך זה מסתדר?
המדד שלהם בודק רק האם מערכת תמלול מזהה את המילים — כלומר מובנוּת. הוא לא בודק אם ההגייה נכונה, אם ההטעמה במקום, או אם זה נשמע אנושי.
והם כותבים את זה בעצמם: "מודל יכול לקבל ציון טוב במדדי תמלול ועדיין להחטיא את המנגינה, להישמע לא טבעי, ולהיכשל בדמיון לדובר".
המספר לא שקרי. הוא פשוט לא מודד את מה שחשוב לכם.
כלל הזהב אם אתם בכל זאת מנסים
הקלטת הרפרנס חייבת להיות בעברית.
זו הנחיה של יצרן המודל עצמו: אם תיתנו לו רפרנס באנגלית ותבקשו פלט בעברית, תקבלו עברית במבטא אנגלי. זו טעות נפוצה ושקטה.
מקומי מול ענן: מה זה עולה לכם באמת
"רץ על המחשב שלך" נשמע כמו יתרון טכני. בפועל זו החלטה עסקית.
הכלל בשורה אחת
האודיו עוזב את המחשב שלכם רק אם הספק שבחרתם דורש העלאה.
זו כל התורה. הבחירה בין מודל מקומי לענן היא הבחירה בין "הקול נשאר אצלי" לבין "הקול נשלח לשרת של חברה".
לרוב האנשים זה לא משנה. אבל אם אתם מתמללים פגישות לקוחות, חומר רפואי או משפטי — זו כבר לא שאלה טכנית.
המחיר האמיתי של "מקומי": כרטיס מסך
הרצה מקומית היא חינמית בכסף ויקרה בזמן.
התיעוד הרשמי של Voicebox מגדיר את דרישות המערכת: מינימום 8GB זיכרון, ומומלץ כרטיס NVIDIA. הוא גם מסווג את המנוע היחיד שתומך בעברית כ"כואב" להרצה על מעבד רגיל.
במדידה שלנו על מחשב בלי כרטיס NVIDIA: 50 שניות המתנה כדי לייצר 6 שניות של דיבור. פי 6 עד 13 מזמן אמת.
מה מתאים לכם
מה אתם צריכים לעשות?
להפסיק להקליד — הכתבה
האם התוכן רגיש (לקוחות, רפואי, משפטי)?
כן, רגיש
מודל מקומי, ובלי פשרות. אפליקציית הכתבה עם מודל ivrit.ai מקומי — הקול לא עוזב את המחשב, והדיוק בעברית הוא הטוב ביותר מבין המודלים הפתוחים.
לא במיוחד
ספק ענן חינמי יספיק ויהיה מהיר יותר. Groq נותן עד 8 שעות אודיו ביום בחינם, וזה הרבה מעבר לשימוש יומיומי רגיל.
קריינות לסרטון או לפודקאסט
בעברית או באנגלית?
עברית
ElevenLabs במודל v3, ולא במודל אחר. זה עולה כסף (מ-6 דולר בחודש לשימוש מסחרי), אבל זו האפשרות היחידה שנותנת תוצאה שאפשר לפרסם. נקדו את הטקסט לפני, וכתבו מספרים במילים.
אנגלית
כאן Voicebox מבריק: חינמי לגמרי, בלי מגבלת תווים, רץ מקומית, ובאנגלית האיכות מצוינת. זה בדיוק המקרה שבו הוא באמת מחליף מנוי בתשלום.
לשכפל את הקול שלי לעברית
כרגע, בכנות: אין פתרון חינמי טוב. שכפול מקומי בעברית נותן תוצאה לא שמישה (מדדנו 65% שגיאות). האפשרות היחידה שעובדת היא ElevenLabs בתשלום. אם אתם לא ממהרים — שווה לחכות.
מדריך מלא: Voicebox מקצה לקצה
עכשיו נתקין ונפעיל את הכלי צעד אחר צעד — כדי שתדעו בדיוק מה מקבלים, ואיפה נעצרים.
התקנה: 4 צעדים
- הורידו את המתקין. אתר הכלי הוא voicebox.sh, וההורדה לוינדוס היא קובץ אחד במשקל כ-542MB. אין צורך ב-Python ולא בשום כלי מפתחים — מה שכתוב על זה ב-GitHub מיועד רק למי שבונה מהקוד.
- צפו לאזהרת SmartScreen. האפליקציה לא חתומה דיגיטלית. לוחצים "More info" ואז "Run anyway". התיעוד עצמו אומר שזה צפוי.
- ההפעלה הראשונה איטית. המודלים לא כלולים בהתקנה — הם יורדים בפעם הראשונה שמייצרים דיבור. מודל העברית שוקל לבדו כ-3.2GB.
- יש לכם כרטיס NVIDIA? האפליקציה תציע להתקין את מנוע ה-CUDA. זו הורדה נוספת של כ-4GB, והיא שווה כל ביט.

לשכפל קול: התהליך
- New Voice — יוצרים פרופיל חדש.
- מגדירים שפה: Hebrew. אל תדלגו על זה.
- מעלים או מקליטים דגימה — 10 עד 30 שניות של דיבור נקי, בלי רעש רקע ובלי מוזיקה. הדגימה חייבת להיות בעברית.
- מייצרים משפט מבחן ומקשיבים.
אם התוצאה גרועה — מוסיפים עוד דגימות של אותו דובר. ערבוב דוברים שונים הורס את התוצאה.

המגבלה שקובעת הכל: מנוע אחד בלבד
ב-Voicebox יש שבעה מנועי קול. עברית קיימת רק באחד מהם — Chatterbox Multilingual. בדקנו את זה ברמת הקוד, לא לפי השיווק.
וזו בדיוק הבעיה: המנוע שהתיעוד מגדיר כאיכותי ביותר (Qwen3-TTS) אינו זמין לכם. המנוע היחיד שכן — הוא גם הכבד ביותר להרצה, וגם זה שההגייה שלו בעברית נשברת.
המבחן האמיתי אינו "נשמע טוב?" אלא "האם מכונה אחרת מזהה את המילים?". זו בדיקה אובייקטיבית שאפשר לחזור עליה.
בדיקת האמת של Voicebox, ב-3 צעדים: 1. צרו פרופיל קול, הגדירו שפה Hebrew, והעלו הקלטה שלכם בעברית (20-30 שניות). 2. הכניסו את המשפט הזה בדיוק — הוא מכיל את שלושת המוקשים: מילה באנגלית, מספר, ומילה נדירה: "תוך 5 דקות תוכלו לשכפל את הקול שלכם עם Voicebox ולייצר קריינות מלאה." 3. עכשיו הקשיבו — ואז הדביקו את ההקלטה לכלי תמלול טוב, ותנו לו לכתוב מה שהוא שמע. השוו למקור. כמה מילים שרדו? זו הבדיקה, וזו התשובה.
לתת קול לסוכן AI
היכולת הכי מעניינת ב-Voicebox היא דווקא לא הקריינות — אלא זו שאף אחד לא מדבר עליה.
מה זה MCP, בלי ז'רגון
MCP הוא תקן שמאפשר לחבר כלים חיצוניים לעוזר AI כמו קלוד. במקום שהעוזר רק יכתוב לכם טקסט — הוא יכול להשתמש בכלים במחשב שלכם.
Voicebox מריץ שרת כזה בעצמו. המשמעות: אתם יכולים לתת לקלוד קול — שלכם או אחר — והוא יקריא לכם תשובות בקול הזה, מקומית, בלי ענן.
החיבור לקלוד — פקודה אחת
Voicebox חייב לרוץ ברקע כדי שזה יעבוד.
claude mcp add voicebox --transport http --url http://127.0.0.1:17493/mcp --header "X-Voicebox-Client-Id: claude-code"
אחרי זה יש לקלוד 4 יכולות חדשות: לדבר, לתמלל, ולראות הקלטות וקולות שמורים.
אזהרת אבטחה שהפרויקט מודה בה בעצמו
מהתיעוד, מילה במילה: "אין אימות כרגע. כל תהליך שמצליח להתחבר ללולאה המקומית שלכם יכול לקרוא ל-MCP."
השרת אמנם מאזין רק לתוך המחשב עצמו ולא לרשת החיצונית, אבל שווה לדעת מה הסטטוס לפני שמחברים.
הצד החיובי: כל השמעה שסוכן יוזם מציגה חיווי גלוי על המסך — בכוונה. כדבריהם, "הקראה שקטה ברקע היא מפגע אמון".
אתיקה, סימני מים וגילוי ביוטיוב
כאן רוב המדריכים או מפחידים אתכם לחינם, או מתעלמים לגמרי. בואו נהיה מדויקים.
האודיו שלכם מסומן — ואתם לא יכולים לכבות את זה
כל קובץ שנוצר ב-Chatterbox (וזה המנוע היחיד עם עברית) מקבל סימן מים בלתי-נשמע. גם גוגל עושה את זה בכלים שלה.
הסימן לא נשמע לאוזן, ולפי היצרן הוא שורד דחיסה ועריכה.
מה הוא כן אומר, בלשון היצרן: "האודיו הזה נוצר ב-Chatterbox" — וזהו. הוא לא מזהה מי יצר אותו.
הכלל המדויק של יוטיוב (וזו הפתעה טובה)
יוטיוב דורש גילוי על תוכן ריאליסטי שנוצר ב-AI.
אבל ברשימת מה שלא דורש גילוי כתוב במפורש: "שכפול הקול של עצמך ליצירת קריינות או דיבוב".
כלומר: שכפלתם את הקול שלכם לקריינות? אתם לא צריכים תווית גילוי. שכפלתם קול של מישהו אחר, או ייצרתם דמות ריאליסטית? כן צריך.
אל תבלבלו בין שני דברים
מסתובבת אמירה ש"סימן מים פוגע במונטיזציה". לא מצאנו לזה שום מקור רשמי — לא אצל היצרן, לא בגוגל, ולא ביוטיוב.
סימן מים הוא כלי ייחוס וגילוי, לא מנגנון ענישה.
הסיכון האמיתי ביוטיוב הוא אי-גילוי של קול של אדם אחר. על זה כן יש סנקציה, עד הסרת תוכן והוצאה מתוכנית השותפים.
תרגול: בדקו לבד, אל תאמינו לאף אחד
הדבר הכי שימושי שתיקחו מהקורס הוא לא כלי — אלא שיטת בדיקה. היא לוקחת 10 דקות ועובדת על כל כלי קול, גם על כאלה שעדיין לא יצאו.
בונוס: הריצו את אותה בדיקה פעמיים — פעם עם הטקסט כמו שהוא, ופעם אחרי שניקדתם אותו בנקדן של דיקטה. ההפרש בין שתי התוצאות הוא בדיוק כמה שווה הניקוד.
מבחן הלוך-ושוב (round-trip). זו בדיוק השיטה שבה מדדנו את Voicebox. הרעיון: אל תשאלו "נשמע לי טוב?" — זו שאלה סובייקטיבית. שאלו "האם מכונה אחרת מזהה את המילים?". **הצעדים:** 1. קחו את משפט המבחן הזה. הוא מכיל בכוונה את שלושת המוקשים של עברית — מילה באנגלית, מספר, ומילה ארוכה: "תוך 5 דקות אפשר לייצר קריינות מלאה בעברית עם ChatGPT, בלי שום ידע טכני." 2. הכניסו אותו לכלי הקריינות שאתם בודקים, וייצרו אודיו. 3. עכשיו קחו את האודיו שיצא, והכניסו אותו לכלי **תמלול** טוב. 4. השוו את מה שהתמלול כתב למשפט המקורי. ספרו כמה מילים שגויות. **איך לקרוא את התוצאה:** מעל 30% מילים שגויות — הכלי לא שמיש לעברית, לא משנה מה כתוב באתר שלו.
סיכום: מה לעשות מחר בבוקר
חמש שורות שכדאי לזכור
- התחילו מההכתבה. זו היכולת שהכי בשלה בעברית, היא חינמית, והיא תחזיר לכם שעות כבר השבוע.
- בחרו מודל גדול. בעברית, מודל קטן אינו "קצת פחות טוב" — הוא חסר תועלת. הפער בין 44% שגיאות ל-8% הוא בדיוק ההבדל הזה.
- לקריינות בעברית — Gemini (חינם) או ElevenLabs v3. מדדנו 4% שגיאות בשניהם. נקדו לפני, וכתבו מספרים במילים.
- שכפול קול חינמי-מקומי עדיין לא בשל. מדדנו 65% שגיאות ב-Voicebox. אל תבזבזו ערב — זו היכולת היחידה שבאמת נשברת בעברית.
- בדקו לבד. מבחן הלוך-ושוב לוקח 10 דקות ועובד על כל כלי, לנצח.
גילוי נאות
אפליקציית "הכתבה בעברית" שמופיעה בקורס נבנתה על ידי הנרי. היא חינמית ובקוד פתוח.
היא נכנסה לקורס כי היא רלוונטית לנושא, לצד כלים מתחרים — ולא כדי לקדם אותה. כל המספרים בקורס נמדדו בשיטה שמתוארת בפרק התרגול, ואתם מוזמנים לחזור עליה בעצמכם.
שאלות נפוצות
האם Voicebox באמת תומך בעברית?
טכנית כן, אבל רק במנוע אחד מתוך שבעה (Chatterbox Multilingual), ובפועל האיכות חלשה. במדידה שערכנו, 65 אחוז מהמילים בקריינות עברית יצאו שגויות. ההכתבה בעברית, לעומת זאת, עובדת בו מצוין. הכלי מצוין לאנגלית ולהכתבה, ולא לקריינות עברית.
מה הכלי הכי טוב לקריינות בעברית?
מדדנו את זה בעצמנו: גם Gemini וגם ElevenLabs v3 נתנו 4% שגיאות בלבד בעברית — מעולה. Gemini חינמי דרך Google AI Studio, ולכן זו נקודת פתיחה מצוינת. ElevenLabs v3 דורש מסלול בתשלום לשימוש מסחרי, אך נותן את השליטה הרבה ביותר. הימנעו מהמודל הישן של ElevenLabs (v2) — הוא לא באמת יודע עברית.
איך משפרים את ההגייה של קריינות בעברית?
נקדו את הטקסט לפני שאתם מכניסים אותו לכלי, למשל בעזרת הנקדן החינמי של דיקטה. בנוסף, כתבו מספרים במילים ולא כספרות, כי לספרות בעברית יש מין דקדוקי שהמודל טועה בו. שתי הפעולות האלה משפרות את התוצאה יותר מכל הגדרה אחרת.
מה הכלי הכי טוב להכתבה קולית בעברית?
המודלים של ivrit.ai הם המדויקים ביותר מבין הפתוחים, ובדיבור ספונטני הם עוקפים את Whisper של OpenAI. אפשר להריץ אותם מקומית בחינם, בלי שהאודיו עוזב את המחשב. ההכתבה המובנית של וינדוס אינה תומכת בעברית כלל.
האם שכפול קול ב-AI פוגע במונטיזציה ביוטיוב?
לא. אין שום מקור רשמי שקושר בין סימן מים לבין פגיעה במונטיזציה. יתרה מזו, יוטיוב קובע במפורש ששכפול הקול של עצמכם ליצירת קריינות אינו מחייב תווית גילוי. הסיכון האמיתי הוא אי-גילוי כששוכפל קול של אדם אחר.
האם צריך כרטיס מסך כדי להריץ כלי קול על המחשב?
להכתבה, לא — היא עובדת סביר גם על מעבד רגיל. לקריינות ולשכפול קול, כן. במדידה שלנו על מחשב בלי כרטיס NVIDIA, ייצור 6 שניות של דיבור לקח כ-50 שניות, כלומר פי 6 עד 13 מזמן אמת.
סרטונים קשורים
כלים בקורס
מקורות
- Voicebox — הריפו הרשמי — GitHub / Jamie Pine, 2026-07-14
- Voicebox Issue 199 — דיווח משתמש על איכות העברית — GitHub, 2026-07-14
- Chatterbox Multilingual v3 — הכרזה ומתודולוגיית המדידה — Resemble AI, 2026-07-14
- Robust Speech Recognition via Large-Scale Weak Supervision (Whisper) — OpenAI, 2026-07-14
- Building an Accurate Open-Source Hebrew ASR System through Crowdsourcing — Interspeech 2025 / ivrit.ai, 2026-07-14
- Models — תמיכת השפות של ElevenLabs — ElevenLabs, 2026-07-14
- Phonikud — המרת טקסט עברי לפונמות בזמן אמת — GitHub, 2026-07-14
- גילוי שימוש בתוכן שנוצר בבינה מלאכותית — YouTube Help, 2026-07-14
- Models & Languages Overview — תמיכת העברית של Deepgram — Deepgram, 2026-07-14
- הכתבה קולית במחשב — תמיכת השפות של וינדוס — Microsoft Support, 2026-07-14