Hodnocení automatického rozpoznávání řeči

Word error rate

Word error rate je metrika pro přepis řeči vypočítaná jako součet substitúcií, vynechaní a vložení dělený počtem slov v referenčnom prepise. Počty chyb vznikají z minimálnej editovacej vzdálenosti mezi normalizovanou referencí a hypotézou. WER může presiahnuť 100 procent, pokud systém vloží mnoho nadbytočných slov. Hodnota závisí na pravidel tokenizace, interpunkce, čísiel, velkých písmen, diakritiky a od toho, co se považuje za slovo. Metrika váží všechny slovné chyby stejně, proto nemusí vyjadrovat významovou závažnost, správnost mien ani použitelnost pro konkrétní proces.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-23

Odborná definice

Odborná definice

Word error rate je metrika pro přepis řeči vypočítaná jako součet substitúcií, vynechaní a vložení dělený počtem slov v referenčnom prepise. Počty chyb vznikají z minimálnej editovacej vzdálenosti mezi normalizovanou referencí a hypotézou. WER může presiahnuť 100 procent, pokud systém vloží mnoho nadbytočných slov. Hodnota závisí na pravidel tokenizace, interpunkce, čísiel, velkých písmen, diakritiky a od toho, co se považuje za slovo. Metrika váží všechny slovné chyby stejně, proto nemusí vyjadrovat významovou závažnost, správnost mien ani použitelnost pro konkrétní proces.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Referenční přepis hovoří model dnes funguje a systém napíše model dobře funguje teraz. Porovnávací algoritmus hledá najlacnejší způsob, jako jednu větu změnit na druhou, tedy které slovo nahradit, vymazat nebo vložit. Součet těchto operací se vydelí počtem slov v správném textu. Výsledek je jednoduchý a srovnatelný pouze tehdy, když oba tímy používají stejnou normalizaci. V zdravotnom diktáte může jedno zamenené jméno lieku způsobit větší riziko než peť chyb v spojkách, ačkoli WER jejich nerozlišuje.

Časté otázky

Časté otázky

Jaký je přesný vzorec WER?

WER se počítá jako S plus D plus I dělené N, kde S jsou substitúce, D vynechání, I vložení a N počet slov v referencii.

Proč může být WER vyšší než 100 procent?

Počet vložených slov není omezený délkou reference. Systém může produkovat dlouhý halucinovaný text a vytvořit více chyb, než je referenčních slov.

Má se odstranit interpunkce?

Závisí na cíle. Pokud model interpunkci negeneruje, často se normalizuje. Při diktování, titulkoch nebo právním prepise může být interpunkce samostatnou požiadavkou.

Kdy je vhodnější CER?

Při jazycích bez jasných hranic slov, při menách, kódoch nebo úlohách, kde je důležitá znaková přesnost. Character Error Rate používá stejný princip na znakoch.

Jak se porovnávají dva ASR systémy férovo?

Na stejném audiu, s stejnou referencí, normalizací, segmentací a slovníkem. Je třeba uvést i typ šumu, jazyk, doménu a interval nejistoty.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • TensorFlow Hub, Wav2Vec2 fine-tuning and WER
  • NIST, Speech Recognition Scoring Toolkit

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.