Automatický přepis a překlad řeči

rodina modelů Openai na rozpoznávání řeči

Whisper je rodina encoder-decoder transformerů na automatické rozpoznávání řeči, identifikaci jazyka, časové značky a překlad řeči do angličtiny. Model přijímá log-Mel spektrogram zvukových úseků a autoregresívne generuje text spolu se špeciálnymi tokenmi určujúcimi úlohu. Původná rodina byla trénovaná na 680 000 hodinách vícejazyčných a viacúlohových dat získaných z webu. Jednotlivé checkpointy se liší velikostí, rýchlosťou a přesností. Whisper není název obecné cloudovej služby ani záruka správného přepisu, protože výkon závisí na jazyka, šumu, mluvčího, segmentace a dekódování.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-19

Odborná definice

Odborná definice

Whisper je rodina encoder-decoder transformerů na automatické rozpoznávání řeči, identifikaci jazyka, časové značky a překlad řeči do angličtiny. Model přijímá log-Mel spektrogram zvukových úseků a autoregresívne generuje text spolu se špeciálnymi tokenmi určujúcimi úlohu. Původná rodina byla trénovaná na 680 000 hodinách vícejazyčných a viacúlohových dat získaných z webu. Jednotlivé checkpointy se liší velikostí, rýchlosťou a přesností. Whisper není název obecné cloudovej služby ani záruka správného přepisu, protože výkon závisí na jazyka, šumu, mluvčího, segmentace a dekódování.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Whisper nejprve premení zvuk na obraz frekvencí v čase. Encoder z něho vytvoří reprezentaci a decoder postupně zapisuje tokeny přepisu, podobně jako jazykový model podmíněný nahrávkou. Špeciálne tokeny mu povedia, zda má prepisovat, překládat, určit jazyk nebo vracet časové úseky. Díky různorodým tréninkovým datům zvláda mnoho akcentů a prostředí, ale může vynechat jména, domyslieť větu v tichu nebo nesprávně rozdelit hovorců. Produkční systém proto potřebuje detekci řeči, slovník, confidence signály a kontrolu citlivých prepisů.

Časté otázky

Časté otázky

Je Whisper model na text-to-speech?

Ne. Je určený zejména na speech-to-text a překlad řeči do angličtiny. Nevytváří zvukový výstup ani hlas mluvčího.

Proč zpracovává přibližně 30-sekundové okna?

Původná architektura používá pevný kontext zvuku a špeciálne časové tokeny. Dlouhé nahrávky se segmentují nebo dekódují posuvným způsobem s prenášaným kontextem.

Co znamenají velikosti tiny až large?

Jde o checkpointy s rozdílným počtem parametrů a výpočtovým nárokom. Menší modely jsou rychleji, větší bývají přesněji, zejména při náročných jazycích.

Ví Whisper diarizovat hovorců?

Ne přímo jako základní úloha. Diarizace vyžaduje samostatný model nebo pipeline, která určí, kdo hovoří, a následně spojí segmenty s prepisom.

Jak se má hodnotit slovenský přepis?

Na reprezentatívnych slovenských nahrávkach pomocí WER nebo CER, s jasnou normalizací interpunkce, čísiel a diakritiky. Je třeba oddělit bežnou řeč, šum a odborný slovník.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • OpenAI, Introducing Whisper Robust Speech Recognition via Large-Scale Weak Supervision

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.