Odborná definícia
Odborná definícia
Text-to-speech je technológia, ktorá premieňa text na zvukový signál reči. Typický systém spracuje text, určí výslovnosť, rytmus a intonáciu, vytvorí akustickú reprezentáciu a vocoderom ju prevedie na zvuk. Neurónové modely môžu napodobniť konkrétny hlas alebo riadiť štýl prejavu. Kvalita sa neposudzuje iba prirodzenosťou, ale aj zrozumiteľnosťou, správnou výslovnosťou mien a čísel, stabilitou dlhého textu, latenciou a oprávnením používať hlasový profil. Hlasový model sa testuje osobitne na skratkách, jednotkách, adresách, cudzích menách a dlhých číselných reťazcoch.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
TTS najprv potrebuje pochopiť, ako sa má text vysloviť. Skratka, dátum a číslo môžu mať viac čítaní, preto normalizácia textu rozhoduje o výsledku. Model potom vytvorí melódiu reči a zvukové vlastnosti, z ktorých vocoder syntetizuje vlnu. Pri hlasovom asistentovi je dôležitá nízka latencia, pri audioknihe dlhodobá konzistentnosť postavy a tempa. Ak systém napodobňuje konkrétnu osobu, technická kvalita nestačí, potrebný je súhlas, evidencia pôvodu a ochrana pred zneužitím. V kritickom oznámení je správne vyslovené číslo dôležitejšie než všeobecný dojem prirodzenosti.
Časté otázky
Časté otázky
Aký je rozdiel medzi TTS a voice cloningom?
TTS všeobecne vytvára reč z textu. Voice cloning navyše prispôsobuje hlasové vlastnosti konkrétnej osobe, často z krátkej alebo rozsiahlej hlasovej vzorky.
Čo robí vocoder?
Prevádza akustické reprezentácie, napríklad mel-spektrogram, na časový zvukový signál. Jeho kvalita ovplyvňuje čistotu, šum a prirodzenosť syntetickej reči.
Ako sa hodnotí zrozumiteľnosť?
Posluchovými testami, chybovosťou automatického prepisu a kontrolnými zoznamami pre názvy, čísla, skratky a doménové výrazy. Prirodzený hlas môže stále vyslovovať kritické údaje nesprávne.
Dá sa riadiť emócia alebo tempo?
Niektoré modely podporujú štýlové tokeny, referenčný zvuk, SSML alebo explicitné parametre. Rozsah kontroly a stabilita sa medzi systémami výrazne líšia.
Aké bezpečnostné opatrenia sú dôležité?
Súhlas vlastníka hlasu, obmedzenie použitia, auditné logy, označenie syntetickej reči, detekcia zneužitia a ochrana tréningových aj referenčných nahrávok.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
- Google Cloud Text-to-Speech documentation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
