Preklad a sekvenčné modelovanie

Neural machine translation

Neurónový strojový preklad

Neural machine translation, skrátene NMT, je prístup k strojovému prekladu, v ktorom neurónový model odhaduje pravdepodobnosť cieľovej sekvencie podmienenej zdrojovým textom. Súčasné systémy používajú najmä Transformer architektúry s attention mechanizmom a subword tokenizáciou. Model sa učí z paralelných korpusov, prípadne z monolingválnych dát, spätného prekladu a viacjazyčného transferu. Výstup vzniká dekódovaním a môže byť plynulý aj vtedy, keď vynechá informáciu, zmení negáciu alebo nesprávne preloží termín.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-12

Odborná definícia

Odborná definícia

Neural machine translation, skrátene NMT, je prístup k strojovému prekladu, v ktorom neurónový model odhaduje pravdepodobnosť cieľovej sekvencie podmienenej zdrojovým textom. Súčasné systémy používajú najmä Transformer architektúry s attention mechanizmom a subword tokenizáciou. Model sa učí z paralelných korpusov, prípadne z monolingválnych dát, spätného prekladu a viacjazyčného transferu. Výstup vzniká dekódovaním a môže byť plynulý aj vtedy, keď vynechá informáciu, zmení negáciu alebo nesprávne preloží termín.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

NMT neprekladá slovo po slove podľa pevného slovníka. Vytvorí reprezentáciu celej zdrojovej vety a postupne vyberá cieľové tokeny tak, aby vytvorili pravdepodobný preklad. To umožňuje prirodzený slovosled a prácu s kontextom, no zároveň môže systém uprednostniť plynulú vetu pred presným významom. Pri zmluve alebo medicínskom texte treba kontrolovať čísla, mená, negáciu, odbornú terminológiu a úplnosť. Automatické skóre musí doplniť revízia človeka, ktorý ovláda oba jazyky aj doménu.

Časté otázky

Časté otázky

Čo je paralelný korpus?

Je to zbierka zdrojových textov a ich zodpovedajúcich prekladov. Kvalita zarovnania, prekladov, domén a licencií priamo ovplyvňuje to, čo sa NMT model naučí.

Prečo sa používa subword tokenizácia?

Rozkladá zriedkavé slová na menšie jednotky, takže model nemusí mať samostatný token pre každý tvar. Pomáha pri skloňovaní a neznámych slovách, ale môže komplikovať odborné názvy.

Čo je spätný preklad?

Monolingválny cieľový text sa automaticky preloží do zdrojového jazyka a vzniknutá syntetická dvojica sa pridá do tréningu. Výsledok závisí od kvality pomocného modelu a filtrovania syntetických dát.

Ako sa meria prekladová kvalita?

Používajú sa BLEU, chrF, COMET a ďalšie metriky, no žiadna sama nezaručuje významovú správnosť. Kritické texty vyžadujú hodnotenie adekvátnosti, terminológie a rizikových chýb človekom.

Prečo môže model vynechať časť vety?

Dekódovanie optimalizuje pravdepodobnosť sekvencie, nie povinné zachovanie každej informácie. Dlhé alebo neobvyklé vety, opakovanie a doménový posun zvyšujú riziko omission error.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Sequence to Sequence Learning with Neural Networks Attention Is All You Need

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.