Transformace řeči

Voice conversion

Voice conversion mění hlasovou identitu, styl, prízvuk nebo další paralingvistické vlastnosti existujúcej řečové nahrávky při snahe zachovat její jazykový obsah a časování. Systém oddeluje obsahové reprezentace od speaker nebo style embeddingu a decoder vytvoří nový akustický signál. Na rozdíl od text-to-speech nevychádza primárně z textu, ale ze zdrojové řeči. Kvalitu ovlivňuje disentanglement, prozodie, šum a rozdíl jazyků. Aplikace zahrnují anonymizaci, dabing i rizikovou impersonaci.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-V-24

Odborná definice

Odborná definice

Voice conversion mění hlasovou identitu, styl, prízvuk nebo další paralingvistické vlastnosti existujúcej řečové nahrávky při snahe zachovat její jazykový obsah a časování. Systém oddeluje obsahové reprezentace od speaker nebo style embeddingu a decoder vytvoří nový akustický signál. Na rozdíl od text-to-speech nevychádza primárně z textu, ale ze zdrojové řeči. Kvalitu ovlivňuje disentanglement, prozodie, šum a rozdíl jazyků. Aplikace zahrnují anonymizaci, dabing i rizikovou impersonaci.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Při klonování hlasu model prečíta nový text hlasom cílové osoby. Při voice conversion už existuje hovorená věta a systém změní, kdo nebo jako ji zdanlivo vyslovil. Obsah, tempo a pauzy mohou zůstat podobné, zatímco farba hlasu se nahradí jiným profilom. To je užitečné při dabingu nebo ochrane identity, ale může přenést i emóciu a chyby zdrojového záznamu. Pokud se obsahová a hlasová reprezentace neoddelia dobře, ve výstupu zůstanou stopy původního mluvčího nebo se změní výslovnost.

Časté otázky

Časté otázky

Jak se voice conversion liší od voice cloning?

Conversion transformuje existujúcu řeč a zachovává její časový průběh. Cloning se často používá s TTS na vytvoření zcela nové výpovědi z textu.

Co znamená any-to-any conversion?

Model dokáže prevádzat mezi hovoriacimi, kterých během tréninku nemusel vidět, pomocí všeobecných obsahových a speaker reprezentací.

Lze konverzí anonymizovat hlas?

Ano, ale jednoduchá změna timbru nemusí odstranit všechny biometrické stopy. Je třeba testovat speaker verification útoky i zpětnou rekonštrukci.

Jak se hodnotí kvalita konverze?

Měří se zrozumitelnost, podobnost cielovému hlasu, zachování obsahu, prirodzenost, prozodie a úspěšnost automatického speaker verifikátora.

Může systém měnit emóciu bez změny identity?

Některé modely oddelují style embedding od speaker identity a umožnia měnit emóciu nebo energii. Oddělení však nebýva úplné a vyžaduje kontrolu artefaktů.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • AutoVC: Zero-Shot Voice Style Transfer with Only Autoencoder Loss StarGAN-VC: Non-parallel many-to-many voice conversion

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.