Řečové technologie

syntéza řeči z textu

Text-to-speech je technologie, která mění text na zvukový signál řeči. Typický systém zpracuje text, určí výslovnost, rytmus a intonaci, vytvoří akustickou reprezentaci a vocoderom ji převede na zvuk. Neuronové modely mohou napodobnit konkrétní hlas nebo riadit styl prejavu. Kvalita se neposudzuje pouze prirodzeností, ale i zrozumitelností, správnou výslovností mien a čísel, stabilitou dlhého textu, latencí a oprávnením používat hlasový profil. Hlasový model se testuje zvlášť na skratkách, jednotkách, adresách, cudzích menách a dlouhých číselných reťazcoch.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-14

Odborná definice

Odborná definice

Text-to-speech je technologie, která mění text na zvukový signál řeči. Typický systém zpracuje text, určí výslovnost, rytmus a intonaci, vytvoří akustickou reprezentaci a vocoderom ji převede na zvuk. Neuronové modely mohou napodobnit konkrétní hlas nebo riadit styl prejavu. Kvalita se neposudzuje pouze prirodzeností, ale i zrozumitelností, správnou výslovností mien a čísel, stabilitou dlhého textu, latencí a oprávnením používat hlasový profil. Hlasový model se testuje zvlášť na skratkách, jednotkách, adresách, cudzích menách a dlouhých číselných reťazcoch.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

TTS nejprve potřebuje pochopit, jak se má text vyslovit. Skratka, datum a číslo mohou mít více čítaní, proto normalizace textu rozhoduje o výsledku. Model potom vytvoří melódiu řeči a zvukové vlastnosti, z kterých vocoder syntetizuje vlnu. Při hlasovom asistentovi je důležitá nízká latence, při audioknihe dlhodobá konzistentnost postavy a tempa. Pokud systém napodobňuje konkrétní osobu, technická kvalita nestačí, potřebný je souhlas, evidence původu a ochrana před zneužitím. V kritickom oznámení je správně vyslovené číslo důležitější než obecný dojem prirodzenosti.

Časté otázky

Časté otázky

Jaký je rozdíl mezi TTS a voice cloningom?

TTS obecně vytváří řeč z textu. Voice cloning navíc přizpůsobuje hlasové vlastnosti konkrétní osobe, často z krátkej nebo rozsáhlé hlasovej vzorku.

Co dělá vocoder?

Převádí akustické reprezentace, například mel-spektrogram, na časový zvukový signál. Jeho kvalita ovlivňuje čistotu, šum a prirodzenost syntetickej řeči.

Jak se hodnotí zrozumitelnost?

Posluchovými testy, chybovosťou automatického přepisu a kontrolnými zoznamami pro názvy, čísla, zkratky a doménové výrazy. Přirozený hlas může stále vyslovovat kritické údaje nesprávně.

Lze riadit emoce nebo tempo?

Některé modely podporují štýlové tokeny, referenční zvuk, SSML nebo explicitní parametry. Rozsah kontroly a stabilita se mezi systémy výrazně liší.

Jaké bezpečnostní opatření jsou důležité?

Souhlas vlastníka hlasu, omezení použití, auditné logy, označení syntetickej řeči, detekce zneužitia a ochrana tréninkových i referenčních nahrávok.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
  • Google Cloud Text-to-Speech documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.