Videnie, reč a multimodalita · Rečové technológie

Syntéza reči z textu

Text-to-speech

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-14

Odborná definícia

Význam a odborné vymedzenie pojmu

Text-to-speech je technológia, ktorá premieňa text na zvukový signál reči. Typický systém spracuje text, určí výslovnosť, rytmus a intonáciu, vytvorí akustickú reprezentáciu a vocoderom ju prevedie na zvuk. Neurónové modely môžu napodobniť konkrétny hlas alebo riadiť štýl prejavu. Kvalita sa neposudzuje iba prirodzenosťou, ale aj zrozumiteľnosťou, správnou výslovnosťou mien a čísel, stabilitou dlhého textu, latenciou a oprávnením používať hlasový profil. Hlasový model sa testuje osobitne na skratkách, jednotkách, adresách, cudzích menách a dlhých číselných reťazcoch.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

TTS najprv potrebuje pochopiť, ako sa má text vysloviť. Skratka, dátum a číslo môžu mať viac čítaní, preto normalizácia textu rozhoduje o výsledku. Model potom vytvorí melódiu reči a zvukové vlastnosti, z ktorých vocoder syntetizuje vlnu. Pri hlasovom asistentovi je dôležitá nízka latencia, pri audioknihe dlhodobá konzistentnosť postavy a tempa. Ak systém napodobňuje konkrétnu osobu, technická kvalita nestačí, potrebný je súhlas, evidencia pôvodu a ochrana pred zneužitím. V kritickom oznámení je správne vyslovené číslo dôležitejšie než všeobecný dojem prirodzenosti.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi TTS a voice cloningom?

TTS všeobecne vytvára reč z textu. Voice cloning navyše prispôsobuje hlasové vlastnosti konkrétnej osobe, často z krátkej alebo rozsiahlej hlasovej vzorky.

Čo robí vocoder?

Prevádza akustické reprezentácie, napríklad mel-spektrogram, na časový zvukový signál. Jeho kvalita ovplyvňuje čistotu, šum a prirodzenosť syntetickej reči.

Ako sa hodnotí zrozumiteľnosť?

Posluchovými testami, chybovosťou automatického prepisu a kontrolnými zoznamami pre názvy, čísla, skratky a doménové výrazy. Prirodzený hlas môže stále vyslovovať kritické údaje nesprávne.

Dá sa riadiť emócia alebo tempo?

Niektoré modely podporujú štýlové tokeny, referenčný zvuk, SSML alebo explicitné parametre. Rozsah kontroly a stabilita sa medzi systémami výrazne líšia.

Aké bezpečnostné opatrenia sú dôležité?

Súhlas vlastníka hlasu, obmedzenie použitia, auditné logy, označenie syntetickej reči, detekcia zneužitia a ochrana tréningových aj referenčných nahrávok.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
  • Google Cloud Text-to-Speech documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.