דף הבית › זיהוי דיבור מקומי
מושגי יסוד · איך עובד תמלול אוטומטי
זיהוי דיבור מקומי: מה זה אומר בפועל
זיהוי דיבור מקומי פירושו שמודל השפה רץ על המחשב שלכם, ההקלטה מומרת לטקסט שם, והקובץ לא עוזב את המכשיר. בעברית משתמשים גם בביטויים ״עיבוד על המכשיר״ ו״תמלול אופליין״ — כולם מתארים את אותו הדבר: אין שלב שבו השמע נשלח לשרת של מישהו אחר.
מה זה בעצם
זיהוי דיבור הוא ההמרה האוטומטית של דיבור לטקסט כתוב. השאלה שהעמוד הזה עוסק בה איננה האם זה עובד, אלא איפה זה קורה. בשירות ענן האפליקציה מקליטה, מעלה את קובץ השמע לשרת של הספק, שם רץ המודל, והטקסט המוכן חוזר אליכם דרך הרשת. בזיהוי דיבור מקומי אותו סוג של מודל יושב כקובץ על הדיסק שלכם, והחישוב מתבצע בזיכרון וביחידת העיבוד הגרפי של המחשב שאתם יושבים מולו. מסלול המידע קצר: מיקרופון או קובץ שמע נכנסים, טקסט יוצא, ואין רשת באמצע.
זו אינה הערת שוליים טכנית אלא בחירה ארכיטקטונית עם השלכות מוחשיות מאוד — על סודיות החומר, על היכולת לעבוד בלי חיבור לאינטרנט, על העלות השוטפת ועל מה שנדרש מהחומרה שלכם.
בעברית אין לזה מונח יחיד מקובע. כותבים ״זיהוי דיבור מקומי״, ״עיבוד על המכשיר״, ״תמלול אופליין״ ולפעמים ״זיהוי דיבור בלי ענן״, וכולם מתארים אותו דבר. הצורה הלועזית ״אונ-דיווייס״ מופיעה בעיקר בטקסטים מתורגמים ופחות בשיח מקצועי בעברית, ולכן העמוד הזה נצמד לשלושת הביטויים הראשונים.
מה קורה מרגע שלוחצים על הקלטה
שרשרת השלבים זהה בשתי הגישות. ההבדל היחיד הוא היכן שלושת השלבים האמצעיים רצים:
- לכידה. השמע נקלט מהמיקרופון או נקרא מקובץ קיים ומומר לפורמט אחיד שהמודל מצפה לו. כאן איכות ההקלטה כבר נחתמה סופית — שום מודל לא ישחזר מידע שמעולם לא נכנס למיקרופון.
- חיתוך לחלונות. ההקלטה מפוצלת למקטעים באורך של עשרות שניות, מפני שמודל זיהוי דיבור מעבד חלון בכל פעם ולא קובץ שלם.
- הסקה. כל חלון עובר במודל, שמפיק רצף טקסט יחד עם חותמות זמן. זה השלב היקר חישובית, וזה השלב שדורש מעבד גרפי.
- זיהוי שפה. נקבע לאיזו שפה שייך הדיבור, מתוך 99 שפות נתמכות, ובלי שתצטרכו לבחור מראש.
- הפרדת דוברים. בהקלטה עם כמה משתתפים רץ שלב נוסף שמחלק את ציר הזמן לפי קול, כדי שבתמלול ייראה מי אמר מה.
- הרכבה. המקטעים מחוברים לתמלול אחד עם חותמות זמן ונשמרים בספרייה מקומית שאפשר לחפש בה.
בשירות ענן, שלבי החיתוך, ההסקה וההפרדה קורים על שרת של מישהו אחר — ולכן קובץ השמע חייב להגיע לשם. בעיבוד מקומי הם קורים על המעבד הגרפי של ה-Mac, ולכן הקובץ פשוט נשאר במקום.
ענן מול מקומי: ההבדל בפועל
שתי הגישות נותנות היום תוצאה שמישה, וההבדל אינו ״איכות מול פרטיות״. ההבדל הוא בכל מה שקורה מסביב לטקסט:
| מקומי — על המחשב | ענן | |
|---|---|---|
| מקום העיבוד | המחשב שלכם | שרת של הספק |
| קובץ השמע יוצא מהמכשיר | לא | כן |
| עובד בלי חיבור לאינטרנט | כן | לא |
| נדרש חשבון משתמש | לא | בדרך כלל כן |
| מודל התשלום | לרוב תשלום חד-פעמי | לרוב לפי דקה או תשלום חוזר |
| דרישות מהחומרה | גבוהות — נדרש מעבד גרפי מודרני | נמוכות |
| משך תמלול של קובץ ארוך | תלוי בדגם המחשב | תלוי בעומס על השרת |
| מה קורה כשאין קליטה | ממשיך לעבוד | נעצר |
שתי השורות האחרונות בטבלה הן הצד הכן של המשוואה: עיבוד מקומי מעביר את עומס החישוב אליכם. ראיון של שעתיים יעסיק את המחשב שלכם למשך זמן מורגש בזמן שהוא מתמלל, והמאוורר יישמע. בתמורה לא נוצר עותק של ההקלטה במקום שאין לכם עליו שליטה, ואין דקות שנספרות.
למה זיהוי דיבור מקומי אפשרי היום על מחשב נייד
מודל זיהוי דיבור מודרני מורכב ממאות מיליוני פרמטרים ומעלה. כדי שהתמלול ירוץ מהר יותר מאורך ההקלטה עצמה, פעולות החישוב חייבות להתבצע על יחידת העיבוד הגרפי, והמודל חייב להיכנס לזיכרון שהמעבד והמעבד הגרפי ניגשים אליו יחד. עד לפני שנים ספורות זה היה מאפיין של שרתים בלבד, וזו הסיבה שכל השירותים בקטגוריה התחילו בענן.
הזיכרון המאוחד של Apple Silicon הוא מה ששינה את זה: המעבד והמעבד הגרפי חולקים את אותו זיכרון, כך שהמודל לא צריך להיות מועתק הלוך ושוב בין שני אזורי זיכרון נפרדים. במחשבי Intel התנאי הזה פשוט לא מתקיים. לכן Lesskeys היא אפליקציה ל-Apple Silicon בלבד: מחשב עם שבב M1 ומעלה הוא דרישת חובה ולא המלצה, ומערכת ההפעלה הנדרשת היא macOS 13 ומעלה. בודקים את זה בתפריט ״על אודות המק הזה״ לפני שמשקיעים זמן בהתקנה.
מה לצפות מרמת הדיוק
בהקלטה נקייה של דובר יחיד, מודל מקומי נותן היום תוצאה טובה. מקורות הטעות כמעט תמיד נמצאים בצד השמע ולא בצד המודל:
- איכות ההקלטה. מיקרופון קרוב לדובר מנצח כל בחירת תוכנה. הד של חדר, מזגן ומרחק משולחן עולים יותר דיוק מכל הגדרה באפליקציה.
- דיבור חופף. כששני אנשים מדברים יחד, אחד מהם ייקלט פחות טוב — וזה נכון לכל מערכת, מקומית או בענן.
- שמות, ראשי תיבות וז׳רגון מקצועי. שמות אנשים, שמות חברות וקיצורים ייכתבו לעיתים קרובות בצורה שנשמעת דומה אבל שגויה. אלה בדיוק המקומות שדורשים מעבר אנושי.
- מבטא כבד ודיבור מהיר. ככל שהדיבור רחוק יותר מהצורה התקנית של השפה, כך יורדת רמת הזיהוי.
- מקור עקיף. שיחת טלפון שנלכדה מרמקול, או משתתף שנשמע דרך מחשב באולם ישיבות, ייתנו תוצאה חלשה משמעותית מהקלטה ישירה.
בכוונה לא מופיע כאן אחוז דיוק. אין לנו מדידה מאומתת שאפשר לצטט, ומספר שנשלף מהאוויר הוא בדיוק סוג ההבטחה שהופכת את התמלול האוטומטי למאכזב. הניסוח הנכון הוא שהפלט הוא טיוטה גולמית: הוא חוסך את רוב עבודת ההקלדה, אבל לא את ההגהה — במיוחד בקטעים שאתם מתכוונים לצטט או להפיץ.
ומה עם עברית
עברית היא שפה עם פחות נתוני אימון מאנגלית בכלים גלובליים, ויש לה מאפיינים שמקשים במיוחד: כתיבה ללא ניקוד, אותיות שימוש שנצמדות למילה, וראשי תיבות עם גרשיים. אצל דוברי עברית מצטרפת לזה העובדה שהשיח העסקי משובץ אנגלית כמעט תמיד. כל אלה משפיעים על התוצאה, ומי שרוצה הערכה מפורטת ולא סיסמה ימצא אותה בעמוד תמלול בעברית — עד כמה זה באמת עובד.
מה ״לא יוצא מהמחשב״ אומר, ומה הוא לא אומר
עיבוד מקומי הוא אמירה על ארכיטקטורה: אין העלאה של קובץ השמע, אין שירות שמקבל אותו בצד השני, ולכן גם אין ספק חיצוני שמעבד את החומר עבורכם. לא נדרש חשבון משתמש, והאפליקציה עובדת גם במצב טיסה.
מה שלא נובע מזה: קביעה כלשהי לגבי החוקיות של מה שאתם עושים עם ההקלטה. האם מותר להקליט שיחה מסוימת, לשמור אותה, לנתח אותה ולכמה זמן — זה תלוי במטרה, במעורבים ובארגון. אנחנו לא טוענים כאן לעמידה בתקן, לתאימות או להסמכה כלשהי, לא לחוק הגנת הפרטיות ולא לרגולציה אירופית; ההערכה הזאת שייכת ליועץ המשפטי או לממונה הגנת הפרטיות אצלכם. מה שהארכיטקטורה כן עושה זה להסיר מהשולחן את השאלה שנשאלת ראשונה: לאן ההקלטה הולכת. פירוט של זרימת המידע נמצא בעמוד תמלול בלי העלאה לענן.
כשמקליטים אנשים אחרים
ברגע שיש בהקלטה עוד מישהו, השאלה הטכנית היא הקטנה מבין השתיים. בישראל, לפי חוק האזנת סתר, התשל״ט-1979, הקלטה של שיחה שאתם עצמכם צד לה אינה ״האזנת סתר״ וככלל אינה אסורה — זה שונה מהותית ממה שנהוג בגרמניה או במדינות בארצות הברית שדורשות הסכמת כל הצדדים, ולכן אין טעם לאמץ לכאן את האזהרות שנכתבו עבורן. לעומת זאת, הקלטה של שיחה בין אחרים שאינכם צד לה, בלי הסכמת אף אחד מהצדדים, היא עבירה פלילית.
ההיתר הזה אינו מרשה הכול. שימוש בהקלטה, הפצתה או שמירתה עשויים לפגוע בפרטיות לפי חוק הגנת הפרטיות, התשמ״א-1981, גם כשההקלטה עצמה הייתה מותרת; ארגון שמנהל מאגר של הקלטות לקוחות או עובדים נושא בחובות נוספות; והקלטה יזומה של עובדים מצד מעסיק היא סוגיה נפרדת שנבחנת בבית הדין לעבודה ודורשת אישור משפטי ויידוע מראש. הכלל המעשי, וגם המנומס, פשוט: אומרים בפתח השיחה שמקליטים, ומשאירים את האמירה הזאת בתוך ההקלטה. אם מישהו מתנגד — לא מקליטים. זהו מידע כללי ולא ייעוץ משפטי; את היישום בארגון שלכם בררו מול עורך הדין או ממונה הפרטיות.
איך זה נראה בפועל
Lesskeys היא אפליקציית Mac שיושבת בשורת התפריטים ועושה שני דברים, שניהם מקומית לגמרי. הראשון הוא הקלטה ותמלול: מקליטים מיקרופון, שמע מערכת או שניהם, ומקבלים תמלול עם חותמות זמן ועם חלוקה לדוברים, בספרייה מקומית שאפשר לחפש בה. השני הוא הכתבה קולית: מחזיקים ⌥Space, מדברים, משחררים — הטקסט המזוהה מועתק ללוח, ואתם מדביקים אותו עם ⌘V. האפליקציה לא מקלידה לבד לתוך תוכנות אחרות, וזו החלטה מכוונת: אתם רואים כל טקסט לפני שהוא נוחת במקום כלשהו.
ההורדה חינם. בגרסה החינמית אפשר להכתיב 5 דקות ביום ולתמלל 5 קובצי שמע ו-5 קובצי וידאו — מכסה כוללת לכל החיים, לא יומית. ההקלטה עצמה אינה מוגבלת, ותמלול חוזר של הקלטה שכבר תומללה אינו מנכה מהמכסה. הסרת המגבלות היא רכישה חד-פעמית אחת בתוך האפליקציה, $49.99, בלי מנוי ובלי חיוב לפי דקות. שימו לב שהמילים ״בלי מנוי״ אינן ״בלי הגבלה״ — הגרסה החינמית מוגבלת במספרים שלמעלה.
אם אתם רוצים לראות את התהליך עצמו צעד אחר צעד, המשיכו לעמוד איך לתמלל הקלטה.
ההורדה חינם. הגרסה החינמית מוגבלת. בלי מנוי. · פתיחת Pro בתשלום חד-פעמי אחד של $49.99 (בחנות הישראלית מוצג הסכום בשקלים) · macOS 13 ומעלה
שאלות נפוצות
מה זה זיהוי דיבור מקומי?
זיהוי דיבור מקומי הוא המרה של דיבור לטקסט שמתבצעת על המחשב עצמו: מודל השפה יושב כקובץ על הדיסק והחישוב רץ על המעבד הגרפי, בלי שקובץ השמע מועלה לשרת כלשהו. בעברית משתמשים גם בביטויים עיבוד על המכשיר ותמלול אופליין, והם מתארים את אותו הדבר.
במה זיהוי דיבור מקומי שונה מתמלול בענן?
בענן ההקלטה מועברת לשרת של הספק, מעובדת שם ולרוב נשמרת שם לפרק זמן לפי מדיניותו, בדרך כלל עם חשבון משתמש ותשלום לפי דקה. בעיבוד מקומי המחשב שלכם מבצע את החישוב, ההקלטה לא עוזבת את המכשיר וזה עובד גם בלי אינטרנט — בתמורה לדרישת חומרה גבוהה יותר.
האם זיהוי דיבור מקומי מדויק כמו הענן?
בהקלטה נקייה של דובר יחיד התוצאה טובה, ומקורות הטעות דומים בשתי הגישות: איכות ההקלטה, דיבור חופף, שמות פרטיים, ראשי תיבות וז׳רגון מקצועי. איננו מפרסמים אחוז דיוק כי אין לנו מדידה מאומתת. הפלט הוא טיוטה גולמית שדורשת הגהה לפני שמצטטים או מפיצים אותה.
איזה מחשב נדרש לזיהוי דיבור מקומי?
מחשב Mac עם מעבד Apple Silicon, כלומר M1 ומעלה, ומערכת macOS 13 ומעלה. מעבד Apple Silicon הוא דרישת חובה ולא המלצה, ומחשבי Intel אינם נתמכים, מפני שהמודל זקוק לזיכרון המשותף של המעבד והמעבד הגרפי.
האם עיבוד מקומי אומר שאני עומד בדרישות הרגולציה?
לא. עיבוד מקומי הוא אמירה על ארכיטקטורה: קובץ השמע לא עוזב את המחשב ואין ספק חיצוני שמקבל אותו. השאלה אם מותר לכם להקליט, לשמור ולנתח שיחה מסוימת, ומהן חובות הארגון בעניין, נבחנת על ידי היועץ המשפטי או ממונה הפרטיות אצלכם. איננו טוענים לעמידה בתקן, לתאימות או להסמכה כלשהי.
האם מותר להקליט שיחה שאני משתתף בה?
לפי חוק האזנת סתר, התשל״ט-1979, הקלטה של שיחה שאתם צד לה אינה האזנת סתר וככלל אינה אסורה, בעוד הקלטה של שיחה בין אחרים בלי הסכמת אף צד היא עבירה פלילית. גם הקלטה מותרת אינה מכשירה כל שימוש בה — הפצה ושמירה עשויות לפגוע בפרטיות. מומלץ לומר בפתח השיחה שמקליטים. זהו מידע כללי ולא ייעוץ משפטי.