Odborná definice
Odborná definice
Speech recognition je převod zvukového signálu řeči na text nebo jinou symbolickou reprezentaci. Systém zpracovává akustické vlastnosti, modeluje jazykové pravděpodobnosti a dekóduje nejpravděpodobnější sekvenci slov, tokenů nebo foném. Moderní modely mohou být end-to-end a trénované na rozsáhlých vícejazyčných datech. Výkon ovlivňuje hluk, prízvuk, mikrofón, překryv mluvčích, odborná slovná zásoba a způsob segmentace zvuku. Pro živé použití se zvlášť měří zpoždění čiastkového přepisu a stabilita už zobrazených slov.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Rozpoznávání řeči není jednoduchý přepis každého zvuku na písmeno. Stejná hláska zní jinak podle mluvčího, okolia a susedných slov. Model proto kombinuje zvukové vzory s tím, které slovné pokračování jsou pravdepodobné. Při nahrávke ze zasadnutia musí navíc řešit ticho, prekrývání hlasů, jména a interpunkci. Výsledek může vyzerat plynulo, i když zaměnil klíčový odborný pojem, proto se přesnost hodnotí i na doménových výrazoch. Uživatel potřebuje vědět, zda se skorý přepis ještě může měnit, zejména při titulkoch nebo diktování príkazů.
Časté otázky
Časté otázky
Co je word error rate?
WER počítá minimální počet nahradení, vynechaní a vložení slov vůči referenčnímu přepisu a dělí ho počtem referenčních slov. Nezohladňuje však rozdielnu závažnost chyb.
Jak se řeší více mluvčích?
Diarizace rozděluje zvuk na úseky podle identity mluvčího. Až potom se přepis přiřadí jednotlivým osobám, přičemž překryv hlasů zůstává náročný.
Je rozpoznávání řeči to jisté jako porozumění řeči?
Ne. ASR vytváří text. Zjištění záměru, entít, emoce nebo odpovědi na obsah je další vrstva zpracování.
Jak se zlepšuje odborná slovná zásoba?
Používá se doménové dolaďování, kontextové biasování, vlastní slovník, postprocessing a jazykový model. Zlepšení se musí ověřit bez zhoršení běžných slov.
Jaké jsou rizika při citlivých nahrávkach?
Zvuk může obsahovat biometrické a osobní údaje. Je třeba řešit právní základ, šifrování, dobu uchování, přístup k přepisu a prípadné zpracování externým poskytovatelom.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Robust Speech Recognition via Large-Scale Weak Supervision wav2vec 2.0
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
