Odborná definícia
Odborná definícia
Whisper je rodina encoder-decoder transformerov na automatické rozpoznávanie reči, identifikáciu jazyka, časové značky a preklad reči do angličtiny. Model prijíma log-Mel spektrogram zvukových úsekov a autoregresívne generuje text spolu so špeciálnymi tokenmi určujúcimi úlohu. Pôvodná rodina bola trénovaná na 680 000 hodinách viacjazyčných a viacúlohových dát získaných z webu. Jednotlivé checkpointy sa líšia veľkosťou, rýchlosťou a presnosťou. Whisper nie je názov všeobecnej cloudovej služby ani záruka správneho prepisu, pretože výkon závisí od jazyka, šumu, hovoriaceho, segmentácie a dekódovania.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Whisper najprv premení zvuk na obraz frekvencií v čase. Encoder z neho vytvorí reprezentáciu a decoder postupne zapisuje tokeny prepisu, podobne ako jazykový model podmienený nahrávkou. Špeciálne tokeny mu povedia, či má prepisovať, prekladať, určiť jazyk alebo vracať časové úseky. Vďaka rôznorodým tréningovým dátam zvláda veľa akcentov a prostredí, no môže vynechať mená, domyslieť vetu v tichu alebo nesprávne rozdeliť hovorcov. Produkčný systém preto potrebuje detekciu reči, slovník, confidence signály a kontrolu citlivých prepisov.
Časté otázky
Časté otázky
Je Whisper model na text-to-speech?
Nie. Je určený najmä na speech-to-text a preklad reči do angličtiny. Nevytvára zvukový výstup ani hlas hovoriaceho.
Prečo spracúva približne 30-sekundové okná?
Pôvodná architektúra používa pevný kontext zvuku a špeciálne časové tokeny. Dlhé nahrávky sa segmentujú alebo dekódujú posuvným spôsobom s prenášaným kontextom.
Čo znamenajú veľkosti tiny až large?
Ide o checkpointy s rozdielnym počtom parametrov a výpočtovým nárokom. Menšie modely sú rýchlejšie, väčšie bývajú presnejšie, najmä pri náročných jazykoch.
Vie Whisper diarizovať hovorcov?
Nie priamo ako základná úloha. Diarizácia vyžaduje samostatný model alebo pipeline, ktorá určí, kto hovorí, a následne spojí segmenty s prepisom.
Ako sa má hodnotiť slovenský prepis?
Na reprezentatívnych slovenských nahrávkach pomocou WER alebo CER, s jasnou normalizáciou interpunkcie, čísiel a diakritiky. Treba oddeliť bežnú reč, šum a odborný slovník.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- OpenAI, Introducing Whisper Robust Speech Recognition via Large-Scale Weak Supervision
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
