Překlad a sekvenční modelování

Neuronový strojový překlad

Neural machine translation, zkráceně NMT, je přístup k strojovému překladu, ve kterém neuronový model odhaduje pravděpodobnost cílové sekvence podmienenej zdrojovým textem. Súčasné systémy používají zejména Transformer architektury s attention mechanizmom a subword tokenizací. Model se učí z paralelných korpusů, případně z monolingválnych dat, zpětného překladu a viacjazyčného transferu. Výstup vzniká dekódováním a může být plynulý i tehdy, když vynechá informaci, změní negaci nebo nesprávně preloží termín.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-N-12

Odborná definice

Odborná definice

Neural machine translation, zkráceně NMT, je přístup k strojovému překladu, ve kterém neuronový model odhaduje pravděpodobnost cílové sekvence podmienenej zdrojovým textem. Súčasné systémy používají zejména Transformer architektury s attention mechanizmom a subword tokenizací. Model se učí z paralelných korpusů, případně z monolingválnych dat, zpětného překladu a viacjazyčného transferu. Výstup vzniká dekódováním a může být plynulý i tehdy, když vynechá informaci, změní negaci nebo nesprávně preloží termín.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

NMT neprekladá slovo po slove podle pevného slovníka. Vytvoří reprezentaci celé zdrojové věty a postupně vybírá cílové tokeny tak, aby vytvořili pravdepodobný překlad. To umožňuje přirozený slovosled a práci s kontextem, ale zároveň může systém uprednostnit plynulou větu před presným významom. Při zmluve nebo medicínském textu je třeba kontrolovat čísla, jména, negaci, odbornou terminologii a úplnost. Automatické skóre musí doplnit revize člověka, který ovláda oba jazyky i doménu.

Časté otázky

Časté otázky

Co je paralelní korpus?

Je to zbierka zdrojových textů a jejich zodpovedajúcich prekladů. Kvalita zarovnání, prekladů, domén a licencií přímo ovlivňuje to, co se NMT model naučí.

Proč se používá subword tokenizace?

Rozkladá vzácné slova na menší jednotky, takže model nemusí mít samostatný token pro každý tvar. Pomáhá při skloňování a neznámých slovech, ale může komplikovat odborné názvy.

Co je spetný překlad?

Monolingválny cílový text se automaticky preloží do zdrojového jazyka a vzniknutá syntetická dvojica se přidá do tréninku. Výsledek závisí na kvality pomocného modelu a filtrování syntetických dat.

Jak se měří prekladová kvalita?

Používají se BLEU, chrf, COMET a další metriky, ale žiadna sama nezaručuje významovou správnost. Kritické texty vyžadují hodnocení adekvátnosti, terminológie a rizikových chyb člověkem.

Proč může model vynechat část věty?

Dekódování optimalizuje pravděpodobnost sekvence, ne povinné zachování každé informace. Dlouhé nebo neobvyklé věty, opakování a doménový posun zvyšují riziko omission error.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Sequence to Sequence Learning with Neural Networks Attention Is All You Need

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.