Rečové technológie

Text-to-speech

syntéza reči z textu

Text-to-speech je technológia, ktorá premieňa text na zvukový signál reči. Typický systém spracuje text, určí výslovnosť, rytmus a intonáciu, vytvorí akustickú reprezentáciu a vocoderom ju prevedie na zvuk. Neurónové modely môžu napodobniť konkrétny hlas alebo riadiť štýl prejavu. Kvalita sa neposudzuje iba prirodzenosťou, ale aj zrozumiteľnosťou, správnou výslovnosťou mien a čísel, stabilitou dlhého textu, latenciou a oprávnením používať hlasový profil. Hlasový model sa testuje osobitne na skratkách, jednotkách, adresách, cudzích menách a dlhých číselných reťazcoch.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-14

Odborná definícia

Odborná definícia

Text-to-speech je technológia, ktorá premieňa text na zvukový signál reči. Typický systém spracuje text, určí výslovnosť, rytmus a intonáciu, vytvorí akustickú reprezentáciu a vocoderom ju prevedie na zvuk. Neurónové modely môžu napodobniť konkrétny hlas alebo riadiť štýl prejavu. Kvalita sa neposudzuje iba prirodzenosťou, ale aj zrozumiteľnosťou, správnou výslovnosťou mien a čísel, stabilitou dlhého textu, latenciou a oprávnením používať hlasový profil. Hlasový model sa testuje osobitne na skratkách, jednotkách, adresách, cudzích menách a dlhých číselných reťazcoch.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

TTS najprv potrebuje pochopiť, ako sa má text vysloviť. Skratka, dátum a číslo môžu mať viac čítaní, preto normalizácia textu rozhoduje o výsledku. Model potom vytvorí melódiu reči a zvukové vlastnosti, z ktorých vocoder syntetizuje vlnu. Pri hlasovom asistentovi je dôležitá nízka latencia, pri audioknihe dlhodobá konzistentnosť postavy a tempa. Ak systém napodobňuje konkrétnu osobu, technická kvalita nestačí, potrebný je súhlas, evidencia pôvodu a ochrana pred zneužitím. V kritickom oznámení je správne vyslovené číslo dôležitejšie než všeobecný dojem prirodzenosti.

Časté otázky

Časté otázky

Aký je rozdiel medzi TTS a voice cloningom?

TTS všeobecne vytvára reč z textu. Voice cloning navyše prispôsobuje hlasové vlastnosti konkrétnej osobe, často z krátkej alebo rozsiahlej hlasovej vzorky.

Čo robí vocoder?

Prevádza akustické reprezentácie, napríklad mel-spektrogram, na časový zvukový signál. Jeho kvalita ovplyvňuje čistotu, šum a prirodzenosť syntetickej reči.

Ako sa hodnotí zrozumiteľnosť?

Posluchovými testami, chybovosťou automatického prepisu a kontrolnými zoznamami pre názvy, čísla, skratky a doménové výrazy. Prirodzený hlas môže stále vyslovovať kritické údaje nesprávne.

Dá sa riadiť emócia alebo tempo?

Niektoré modely podporujú štýlové tokeny, referenčný zvuk, SSML alebo explicitné parametre. Rozsah kontroly a stabilita sa medzi systémami výrazne líšia.

Aké bezpečnostné opatrenia sú dôležité?

Súhlas vlastníka hlasu, obmedzenie použitia, auditné logy, označenie syntetickej reči, detekcia zneužitia a ochrana tréningových aj referenčných nahrávok.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
  • Google Cloud Text-to-Speech documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.