Odborná definice
Odborná definice
Text-to-speech je technologie, která mění text na zvukový signál řeči. Typický systém zpracuje text, určí výslovnost, rytmus a intonaci, vytvoří akustickou reprezentaci a vocoderom ji převede na zvuk. Neuronové modely mohou napodobnit konkrétní hlas nebo riadit styl prejavu. Kvalita se neposudzuje pouze prirodzeností, ale i zrozumitelností, správnou výslovností mien a čísel, stabilitou dlhého textu, latencí a oprávnením používat hlasový profil. Hlasový model se testuje zvlášť na skratkách, jednotkách, adresách, cudzích menách a dlouhých číselných reťazcoch.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
TTS nejprve potřebuje pochopit, jak se má text vyslovit. Skratka, datum a číslo mohou mít více čítaní, proto normalizace textu rozhoduje o výsledku. Model potom vytvoří melódiu řeči a zvukové vlastnosti, z kterých vocoder syntetizuje vlnu. Při hlasovom asistentovi je důležitá nízká latence, při audioknihe dlhodobá konzistentnost postavy a tempa. Pokud systém napodobňuje konkrétní osobu, technická kvalita nestačí, potřebný je souhlas, evidence původu a ochrana před zneužitím. V kritickom oznámení je správně vyslovené číslo důležitější než obecný dojem prirodzenosti.
Časté otázky
Časté otázky
Jaký je rozdíl mezi TTS a voice cloningom?
TTS obecně vytváří řeč z textu. Voice cloning navíc přizpůsobuje hlasové vlastnosti konkrétní osobe, často z krátkej nebo rozsáhlé hlasovej vzorku.
Co dělá vocoder?
Převádí akustické reprezentace, například mel-spektrogram, na časový zvukový signál. Jeho kvalita ovlivňuje čistotu, šum a prirodzenost syntetickej řeči.
Jak se hodnotí zrozumitelnost?
Posluchovými testy, chybovosťou automatického přepisu a kontrolnými zoznamami pro názvy, čísla, zkratky a doménové výrazy. Přirozený hlas může stále vyslovovat kritické údaje nesprávně.
Lze riadit emoce nebo tempo?
Některé modely podporují štýlové tokeny, referenční zvuk, SSML nebo explicitní parametry. Rozsah kontroly a stabilita se mezi systémy výrazně liší.
Jaké bezpečnostní opatření jsou důležité?
Souhlas vlastníka hlasu, omezení použití, auditné logy, označení syntetickej řeči, detekce zneužitia a ochrana tréninkových i referenčních nahrávok.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
- Google Cloud Text-to-Speech documentation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
