Odborná definice
Odborná definice
Sequence-to-sequence model mapuje vstupnou sekvenci premenlivej délky na výstupnou sekvenci, která může mít jinou délku. Klasická architektura používá enkóder na reprezentaci vstupu a dekóder na postupné generování výstupu, často s attention mechanizmom. Používá se při preklade, sumarizaci, transkripcii nebo konverzii formátů. Trénink obvykle minimalizuje chybu dalšího tokenu, co samo sám o sobě nezaručuje globálnu správnost celé sekvence. Při hodnocení se kombinuje sekvenční metrika s kontrolou významu a kritických entít.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Prekladatelský systém dostane větu v slovenčine a vytváří větu v jiném jazyku, která nemusí mít stejný počet slov ani stejné pořadí. Enkóder nejprve zpracuje vstup a dekóder skládá výstup krok po kroku. Attention mu umožní při každém kroku podívat se na relevantní část zdrojové věty. Stejný princip lze použít na zhrnutie dokumentu nebo převod řeči na text. Chyba na začátku generování však může ovlivnit všechny další tokeny. Překlad může znieť přirozeně a přitom vynechat negaci, číslo nebo podmínku, která rozhoduje o správnosti.
Časté otázky
Časté otázky
Co dělá enkóder a co dekóder?
Enkóder vytvoří kontextovou reprezentaci vstupu. Dekóder z ní a z už vytvorených tokenů odhaduje další token výstupní sekvence.
Proč byl attention důležitý pro seq2seq modely?
Odstránil potřebu stlačit celý vstup do jediného pevného vektora. Dekóder může při každém kroku využívat jinou váženou kombinaci stavů enkódera.
Co je teacher forcing?
Během tréninku dostává dekóder jako předchozí token správný referenční token, ne vlastní predikci. Trénink je díky tomu stabilnější, ale dekóder se neučí opravovat vlastní skoršie chyby tak jako při nasazení.
Jak se seq2seq výstup dekóduje?
Lze použít greedy výběr, beam search nebo sampling. Volba mění rychlost, rozmanitost i pravděpodobnost, že se najde lepší celá sekvence.
Je transformer sequence-to-sequence model?
Enkóderovo-dekóderový transformer ano. Dekóderové jazykové modely také generují sekvence, ale nemusí mít samostatný enkóder pro zdrojový vstup.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Sequence to Sequence Learning with Neural Networks Neural Machine Translation by Jointly Learning to Align and Translate
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
