Zpracování řeči

Voice activity detection

Voice activity detection, VAD, klasifikuje krátké úseky zvukového signálu jako řeč, neřeč nebo pravděpodobnost řečové aktivity. Používá energii, spektrální příznaky nebo neuronové modely a slouží na segmentaci, spuštění ASR, potlačení ticha a řízení streamování. VAD nerozpoznává obsah ani identitu mluvčího. Musí zvládnout šepot, hudbu, ruch, překryv mluvčích a zpoždění na hranicích slov. Prahy, minimální délka segmentu a hangover mechanismus ovlivňují, zda se neodříznou začátky nebo konce výpovědi.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-22

Odborná definice

Odborná definice

Voice activity detection, VAD, klasifikuje krátké úseky zvukového signálu jako řeč, neřeč nebo pravděpodobnost řečové aktivity. Používá energii, spektrální příznaky nebo neuronové modely a slouží na segmentaci, spuštění ASR, potlačení ticha a řízení streamování. VAD nerozpoznává obsah ani identitu mluvčího. Musí zvládnout šepot, hudbu, ruch, překryv mluvčích a zpoždění na hranicích slov. Prahy, minimální délka segmentu a hangover mechanismus ovlivňují, zda se neodříznou začátky nebo konce výpovědi.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Před prepisom hodinového záznamu je zbytočné posielat do rozpoznávača každou sekundu ticha a hluku. VAD funguje jako brána, která otevře zpracování, když zachytí ludskou řeč, a zatvorí ho po skončení výpovědi. Pokud je příliš citlivá, spustí ASR při hudbe nebo ventilátore. Pokud je prísna, odreže tichou slabiku nebo šepot. V telefonickom botovi ovlivňuje i pocit z rozhovoru, protože oneskorené rozpoznání konca věty spůsobí neprirodzené čakání a příliš rychle ukončení preruší uživatele.

Časté otázky

Časté otázky

Jak se VAD liší od speaker diarization?

VAD určuje, kdy je prítomná řeč. Diarization navíc rozděluje řeč podle toho, který hovoriaci právě rozpráva.

Co je hangover time?

Krátké ponechání segmentu otevřeného po poklese pravděpodobnosti řeči. Chrání konce slov a pauzy ve uvnitř jedné výpovědi.

Proč VAD reaguje na hudbu?

Spev a některé nástroje mají spektrální a rytmické vlastnosti podobné hlasu. Model potřebuje reprezentativní negativně data a vhodný práh.

Jak se měří kvalita VAD?

Sleduje se false alarm rate, missed speech, přesnost hranic, segmentačné zpoždění a dopad na následný ASR nebo komunikačný systém.

Je VAD vhodná pro streamování v reálném čase?

Ano, pokud pracuje kauzální nebo s malým lookaheadom. Offline model s velkým kontextem může být přesnější, ale přidá neprijatelnou latenci.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • WebRTC Voice Activity Detector pyannote.audio, speaker activity detection

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.