Spracovanie reči a self-supervised learning

Wav2Vec 2.0

samoučený model rečových reprezentácií

Wav2Vec 2.0 je architektúra na samoučenie reprezentácií reči z neoznačeného zvuku. Konvolučný encoder premieňa waveform na latentnú sekvenciu, z ktorej sa časti maskujú, transformer vytvára kontextové reprezentácie a kontrastný cieľ rozlišuje správne kvantizované latentné ciele od negatívnych kandidátov. Po predtrénovaní sa model dolaďuje na transkribovaných dátach, často s CTC stratou. Názov označuje rodinu checkpointov a tréningový rámec, nie univerzálny systém s rovnakým jazykom, licenciou alebo presnosťou.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-03

Odborná definícia

Odborná definícia

Wav2Vec 2.0 je architektúra na samoučenie reprezentácií reči z neoznačeného zvuku. Konvolučný encoder premieňa waveform na latentnú sekvenciu, z ktorej sa časti maskujú, transformer vytvára kontextové reprezentácie a kontrastný cieľ rozlišuje správne kvantizované latentné ciele od negatívnych kandidátov. Po predtrénovaní sa model dolaďuje na transkribovaných dátach, často s CTC stratou. Názov označuje rodinu checkpointov a tréningový rámec, nie univerzálny systém s rovnakým jazykom, licenciou alebo presnosťou.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Model najprv počúva veľké množstvo nahrávok bez prepisu. Niektoré úseky vnútornej zvukovej reprezentácie sa zakryjú a sieť sa učí odhadnúť, ktorý diskrétny zvukový kód na dané miesto patrí. Tým si vytvorí citlivosť na fonetiku, rytmus a kontext bez ručného označovania každého slova. Až potom dostane menšiu sadu zvuku s textom a naučí sa mapovať reprezentácie na znaky alebo tokeny. Výkon preto závisí od jazyka predtrénovania, akustickej domény a spôsobu dolaďovania.

Časté otázky

Časté otázky

Je Wav2Vec 2.0 hotový speech-to-text produkt?

Nie nevyhnutne. Základný model poskytuje rečové reprezentácie. Na transkripciu potrebuje vhodnú výstupnú hlavu, slovník, dekódovanie a dolaďovanie pre jazyk alebo doménu.

Prečo používa maskovanie latentných krokov?

Model nemá iba kopírovať lokálny zvukový vstup. Zakrytie núti kontextovú sieť využiť okolie a učiť sa dlhšie závislosti v reči.

Načo slúži kvantizácia v predtrénovaní?

Vytvára diskrétne cieľové jednotky pre kontrastnú úlohu. Codebook sa učí spolu s modelom a jeho rozmanitosť sa podporuje pomocným členom straty.

Ako sa hodnotí výsledný ASR model?

Najčastejšie pomocou Word Error Rate na oddelenom korpuse. Dôležité je uviesť normalizáciu textu, jazyk, typ nahrávky, šum a použitý dekóder.

Kedy nemusí transfer fungovať dobre?

Pri jazyku, prízvuku, kanáli alebo odbornom slovníku výrazne odlišnom od predtrénovania. Pomáha doménové neoznačené audio a reprezentatívne označené dáta.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations fairseq, wav2vec 2.0 examples

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.