Zpracování řeči a self-supervised learning

samoučený model řečových reprezentací

Wav2Věc 2.0 je architektura na samoučení reprezentací řeči z neoznačeného zvuku. Konvolučný encoder mění waveform na latentnou sekvenci, ze které se části maskují, transformer vytváří kontextové reprezentace a kontrastný cíl rozlišuje správně kvantizované latentní cíle od negativních kandidátů. Po předtrénování se model dolaďuje na transkribovaných datech, často s CTC ztrátou. Název označuje rodinu checkpointů a tréninkový rámec, ne univerzální systém s stejným jazykem, licencí nebo přesností.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-03

Odborná definice

Odborná definice

Wav2Věc 2.0 je architektura na samoučení reprezentací řeči z neoznačeného zvuku. Konvolučný encoder mění waveform na latentnou sekvenci, ze které se části maskují, transformer vytváří kontextové reprezentace a kontrastný cíl rozlišuje správně kvantizované latentní cíle od negativních kandidátů. Po předtrénování se model dolaďuje na transkribovaných datech, často s CTC ztrátou. Název označuje rodinu checkpointů a tréninkový rámec, ne univerzální systém s stejným jazykem, licencí nebo přesností.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Model nejprve počúva velké množství nahrávok bez přepisu. Některé úseky vnitřní zvukovej reprezentace se zakryjou a síť se učí odhadnout, který diskrétní zvukový kód na dané místo patří. Tím si vytvoří citlivost na fonetiku, rytmus a kontext bez ručného označování každého slova. Až potom dostane menší sadu zvuku s textem a naučí se mapovat reprezentace na znaky nebo tokeny. Výkon proto závisí na jazyka předtrénování, akustickej domény a způsobu dolaďování.

Časté otázky

Časté otázky

Je Wav2Věc 2.0 hotový speech-to-text produkt?

Ne nevyhnutelně. Základní model poskytuje řečové reprezentace. Na transkripci potřebuje vhodnou výstupnou hlavu, slovník, dekódování a dolaďování pro jazyk nebo doménu.

Proč používá maskování latentných kroků?

Model nemá pouze kopírovat lokální zvukový vstup. Zakrytie núti kontextovou síť využit okolí a učit se déle závislosti v řeči.

K čemu slouží kvantizace v předtrénování?

Vytváří diskrétní cílové jednotky pro kontrastnou úlohu. Codebook se učí spolu s modelem a jeho rozmanitost se podporuje pomocným členom ztráty.

Jak se hodnotí výsledný ASR model?

Nejčastěji pomocí Word Error Rate na oddelenom korpuse. Důležité je uvést normalizaci textu, jazyk, typ nahrávky, šum a použitý dekóder.

Kdy nemusí transfer fungovat dobře?

Při jazyku, prízvuku, kanáli nebo odbornom slovníku výrazně odlišnom od předtrénování. Pomáhá doménové neoznačené audio a reprezentativní označené data.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations fairseq, wav2vec 2.0 examples

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.