Videnie, reč a multimodalita · Rečové technológie

Automatické rozpoznávanie reči

Speech recognition

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-19

Odborná definícia

Význam a odborné vymedzenie pojmu

Speech recognition je prevod zvukového signálu reči na text alebo inú symbolickú reprezentáciu. Systém spracúva akustické vlastnosti, modeluje jazykové pravdepodobnosti a dekóduje najpravdepodobnejšiu sekvenciu slov, tokenov alebo foném. Moderné modely môžu byť end-to-end a trénované na rozsiahlych viacjazyčných dátach. Výkon ovplyvňuje hluk, prízvuk, mikrofón, prekryv hovoriacich, odborná slovná zásoba a spôsob segmentácie zvuku. Pre živé použitie sa osobitne meria oneskorenie čiastkového prepisu a stabilita už zobrazených slov.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Rozpoznávanie reči nie je jednoduchý prepis každého zvuku na písmeno. Rovnaká hláska znie inak podľa hovoriaceho, okolia a susedných slov. Model preto kombinuje zvukové vzory s tým, ktoré slovné pokračovania sú pravdepodobné. Pri nahrávke zo zasadnutia musí navyše riešiť ticho, prekrývanie hlasov, mená a interpunkciu. Výsledok môže vyzerať plynulo, aj keď zamenil kľúčový odborný pojem, preto sa presnosť hodnotí aj na doménových výrazoch. Používateľ potrebuje vedieť, či sa skorý prepis ešte môže meniť, najmä pri titulkoch alebo diktovaní príkazov.

Časté otázky

Otázky, ktoré spresňujú význam

Čo je word error rate?

WER počíta minimálny počet nahradení, vynechaní a vložení slov voči referenčnému prepisu a delí ho počtom referenčných slov. Nezohľadňuje však rozdielnu závažnosť chýb.

Ako sa rieši viac hovoriacich?

Diarizácia rozdeľuje zvuk na úseky podľa identity hovoriaceho. Až potom sa prepis priradí jednotlivým osobám, pričom prekryv hlasov zostáva náročný.

Je rozpoznávanie reči to isté ako porozumenie reči?

Nie. ASR vytvára text. Zistenie zámeru, entít, emócie alebo odpovede na obsah je ďalšia vrstva spracovania.

Ako sa zlepšuje odborná slovná zásoba?

Používa sa doménové dolaďovanie, kontextové biasovanie, vlastný slovník, postprocessing a jazykový model. Zlepšenie sa musí overiť bez zhoršenia bežných slov.

Aké sú riziká pri citlivých nahrávkach?

Zvuk môže obsahovať biometrické a osobné údaje. Treba riešiť právny základ, šifrovanie, dobu uchovania, prístup k prepisu a prípadné spracovanie externým poskytovateľom.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Robust Speech Recognition via Large-Scale Weak Supervision wav2vec 2.0

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.