Úvod › Rozpoznávání češtiny

Čeština · Diktování i přepis nahrávek

Rozpoznávání češtiny na Macu: co čekat

První otázka každého, kdo si chce pořídit diktování nebo přepis, zní stejně: umí to vůbec pořádně česky? Odpověď je „ano, ale“ — a u rozpoznávání češtiny je to „ale“ natolik konkrétní (sedm pádů, obecná čeština, všudypřítomná angličtina), že si zaslouží vlastní stránku. Níže je bez příkras, kde model uspěje a kde si po něm budete číst.

100%zpracování ve vašem Macu — nahrávka se nikam neodesílá
Zdarmastažení; verzi Pro odemkne jednorázový nákup za 49,99 $, žádné předplatné
99jazyků, rozpoznají se automaticky
macOS 13+Apple Silicon (M1 a novější) — nutný

Rozpoznávání češtiny v praxi: krátká odpověď

Čeština patří mezi 99 jazyků, které model zvládá, a jazyk se rozpoznává automaticky. Spisovnou, zřetelně vyslovenou češtinu v rozumně nahraném zvuku přepíše dobře, včetně háčků, čárek a interpunkce. Nesedí ale představa, že z toho vyleze hotový text: model přepisuje to, co slyší, nikoli to, co jste chtěli říct. Rozdíl mezi „dobrý přepis“ a „hotový dokument“ je u češtiny většinou jedno pozorné přečtení.

Procenta přesnosti tady záměrně nenajdete. Nemáme je změřená na českém materiálu a číslo vytažené z anglických testů by o vaší nahrávce nevypovídalo nic.

Diakritika: háčky a čárky nediktujete

Nejčastější obava je zbytečná. Diakritiku doplňuje model sám z kontextu — neříkáte „háček nad c“ ani nic podobného. U běžné slovní zásoby to funguje spolehlivě, protože v češtině je délka a měkkost součástí slova, ne ozdobou.

Kde se to láme: u přejatých slov a značek, kde spisovná i počeštěná podoba existují vedle sebe (management i manažment, e-mail i mail), a u vlastních jmen, kde model musí hádat. „Jiří“ versus „Jirí“ nebo „Šárka“ versus „Sárka“ jsou přesně ta místa, kde se vyplatí kouknout. Podobně dvojice, které se liší jen čárkou a rozhodne až smysl věty — „byt“ a „být“, „rada“ a „ráda“, „pas“ a „pás“ — model rozhodne správně skoro vždy, ale u zkomolené výslovnosti nebo šumu ne.

Skloňování a shoda: model za vás větu nespraví

Tohle je zásadní pro pochopení celého nástroje. Přepis je věrný tomu, co zaznělo. Když nadiktujete špatnou koncovku, zůstane v textu špatná koncovka. Když se rozeběhnete a větu uprostřed přeformulujete, dostanete v textu obě poloviny. Model nedělá jazykovou korekturu, dělá přepis.

Prakticky to znamená, že mluvená čeština, která zní v hovoru naprosto přirozeně, vypadá napsaná hůř, než čekáte — souvětí bez konce, dvojí zápor, opakované „takže“ a „vlastně“. Není to chyba rozpoznávání, je to portrét vaší mluvy. Kdo diktuje pravidelně, si během pár týdnů zvykne mluvit v kratších, dokončených větách a kvalita výstupu se tím zvedne víc než jakýmkoli nastavením.

Obecná čeština: přepíše se přesně to, co řeknete

Jádro věci. Řeknete-li „dobrej“, „sme“, „bysme“, „tydlety“ nebo „vokno“, bude to v textu přesně takhle. Model nepřevádí obecnou češtinu do spisovné a ani by neměl — je to přepisovací nástroj, ne redaktor.

Podle situace je to nevýhoda, nebo naopak přesně to, co potřebujete:

Čeština a angličtina v jedné větě

Nejčastější zdroj překlepů v české firemní a technické mluvě. Věta „na tom tasku ještě musíme udělat review, než to zadeployujeme“ je naprosto běžná — a pro rozpoznávání je to problém, protože jazyk se určuje pro celou nahrávku, ne pro jednotlivá slova. Nahrávka bude označená jako čeština a anglická slova v ní se zapíší foneticky nebo v počeštěné podobě: „dýploj“, „rivjů“, „mítink“ místo očekávaného tvaru.

Co s tím reálně jde dělat:

Čísla, datumy, zkratky a paragrafy

Zápis číslovek je nejméně předvídatelná část výstupu. „Třicátého dubna“, „dvě stě tisíc“ nebo „paragraf sto šestnáct“ se někdy zapíší slovy, jindy číslicemi, a ne vždy stejně v rámci jednoho dokumentu. Podobně kolísá formát data a zápis měny.

U běžného e-mailu je to jedno. U smlouvy, faktury, lékařského záznamu nebo právního podání to jedno rozhodně není, a platí jednoduché pravidlo: čísla a paragrafy si po sobě vždy přečtěte. Zkratky mají tentýž problém z druhé strany — „DPH“, „s. r. o.“, „č. j.“ nebo „ČSN“ se zapíší podle toho, jak je vyslovíte, takže hláskovaná zkratka dopadne jinak než vyslovená jako slovo.

Vlastní jména jsou nejslabší místo

Česká příjmení, názvy obcí a jména firem jsou to, kde model chybuje nejčastěji — a je to očekávatelné: ke slovu, které nikde neviděl, si musí domyslet pravopis podle zvuku. Skloňovaná příjmení („s panem Vaňkem“, „u Hrušků“) tuhle úlohu ještě ztěžují a přechýlené tvary také. Menší obec model klidně zamění za podobně znějící běžné slovo.

Praktický důsledek: pokud přepisujete jednání, ve kterém padají jména účastníků a názvy firem, počítejte s opravou. Pomáhá, když se lidé na začátku nahrávky představí — jméno vyslovené zřetelně a samostatně se přepíše lépe než jméno utopené v rychlé větě. Opakující se jména se vyplatí zavést jako náhrady textu.

Co s tím: rady, které opravdu fungují

Diktování a přepis rozhovoru mají jiná očekávání

U diktování mluvíte do mikrofonu vy sami, zřetelně a bez rušení — to jsou nejlepší možné podmínky a výsledek tomu odpovídá. Nadiktovaný text se zkopíruje do schránky a vy ho vložíte zkratkou ⌘V; aplikace sama do cizích programů nic nepíše.

U přepisu nahrávky je situace opačná: lidé si skáčou do řeči, sedí různě daleko od mikrofonu a mluví, jak jim zobák narostl. Přepis proto bude věrnější mluvě a méně upravený — a u vícečlenných hovorů se hodí rozdělení na mluvčí, aby bylo poznat, kdo co řekl. Nahráváte-li i jiné lidi, řekněte to na začátku nahlas a bez souhlasu nenahrávejte; podrobnosti k českým pravidlům jsou na stránce o zápisu z porady. Toto je informace, nikoli právní poradenství.

Jazyky, požadavky a cena

Rozpoznává se 99 jazyků včetně češtiny a slovenštiny a jazyk se určuje automaticky, takže před každou nahrávkou nic nepřepínáte. Celé zpracování běží ve vašem Macu: zvuk se nikam neodesílá, není potřeba účet a aplikace funguje i bez připojení. Podrobnosti popisuje stránka o lokálním rozpoznávání řeči.

Systémové požadavky jsou pevné: macOS 13 (Ventura) a novější a Mac s čipem Apple Silicon, tedy M1 nebo novější; Macy s procesorem Intel podporované nejsou. Stažení z Mac App Storu je zdarma a plnou verzi odemknete jednorázovým nákupem v aplikaci za 49,99 $ (v českém App Storu se ukáže odpovídající částka v korunách), bez předplatného. Bezplatná verze zahrnuje 5 minut diktování denně a 5 audio a 5 video přepisů celkem, tedy ne denně; nahrávání omezené není a opakovaný přepis už jednou přepsané nahrávky se do limitu nepočítá. Právě to je nejrozumnější způsob, jak si češtinu vyzkoušet na vlastní nahrávce dřív, než za aplikaci utratíte korunu.

Stáhnout z Mac App Storu

Stažení zdarma. Bez předplatného. · Verze Pro je jednorázový nákup v aplikaci za 49,99 $ (v českém App Storu v korunách) · macOS 13 a novější

Časté dotazy

Umí rozpoznávání řeči v Lesskeys česky?

Ano, čeština i slovenština patří mezi 99 podporovaných jazyků a jazyk se rozpoznává automaticky. Spisovnou a zřetelně vyslovenou češtinu v rozumně nahraném zvuku model přepíše dobře, včetně diakritiky a interpunkce. Výstup je ale podklad k redakci, ne hotový dokument.

Musím při diktování říkat háčky a čárky?

Ne, diakritiku doplňuje model sám z kontextu. Chybuje spíš u přejatých slov, značek a vlastních jmen, kde musí pravopis odhadnout ze zvuku. Tam se vyplatí text po sobě přečíst.

Přepíše model obecnou češtinu do spisovné?

Ne, přepíše se přesně to, co řeknete — „dobrej“, „sme“ i „bysme“ zůstanou v textu tak, jak jste je vyslovili. U diktování dokumentu je proto potřeba mluvit spisovně nebo text upravit; u přepisu rozhovoru je doslovnost naopak žádoucí.

Jak si model poradí s anglickými výrazy v české řeči?

Jazyk se určuje pro celou nahrávku, takže anglická slova uvnitř české věty se často zapíší foneticky nebo počeštěně. Pomáhá ponechat v nastavení jen češtinu a angličtinu, delší anglické pasáže diktovat zvlášť a opakující se výrazy si zavést jako náhrady textu.

Proč se pletou česká jména a názvy obcí?

Model si u slova, které nezná, musí domyslet pravopis podle zvuku, a skloňovaná příjmení i názvy menších obcí tuhle úlohu ztěžují. Pomáhá, když se lidé na začátku nahrávky zřetelně představí, a u opakujících se jmen zavedení náhrady textu.

Jak jsou na tom čísla, datumy a paragrafy?

Zápis kolísá: „paragraf sto šestnáct“ nebo „dvě stě tisíc“ se jednou zapíše slovy, jindy číslicemi. U smluv, faktur a podání si proto čísla a paragrafy po sobě vždy přečtěte.

Mohlo by se hodit