Odborná definice
Odborná definice
Speculative decoding je technika zrychlení autoregresívneho generování, při které menší nebo lacnejší draft model navrhne více tokenů a cílový model jejich ověří paralelně v jednom nebo menším počtu kroků. Pokud se použije správný akceptačný algoritmus, výsledné rozdělení může zůstat zhodné s bežným vzorkováním cílového modelu. Zrychlení závisí na ceny draftu, míry prijatia tokenů, hardwaru, délky návrhu a režimu dávkování. Měření musí oddělit čas do prvého tokenu, rychlost pokračování a chování při súbežných požiadavkách.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Velký model běžně vytváří token po tokene a každý krok čaká na předchozí. Při speculative decoding malý model rychle navrhne krátké pokračování, například peť tokenů. Velký model potom zkontroluje celý návrh najednou. Pokud večšinu prijme, ušetrí několik sekvenčních kroků. Pokud se návrhy často mýlia, náklady draftu se nevrátia. Technika proto není obyčajné preberání odpovědi menšieho modelu, ale kontrolované navrhování a verifikace. Technika může zrychlit dlouhé odpovědi, ale nemusí zlepšit krátku interakci, kde dominuje príprava vstupu.
Časté otázky
Časté otázky
Mění speculative decoding kvalitu výstupu?
Při lossless variantě s korektným akceptačným pravidlem zachovává rozdělení cílového modelu. Heuristické varianty mohou rozdělení měnit a musí se hodnotit samostatně.
Co určuje acceptance rate?
Zejména podobnost draft modelu s cielovým modelem v daném kontextu. Ovlivňuje ji i teplota, doména, délka navrhnutého bloku a způsob draftování.
Proč příliš dlouhý draft nemusí pomoci?
Pravděpodobnost, že pozdější tokeny budú prijaté, klesá po prvním nesúlade. Dlouhý návrh zvyšuje práci malého modelu a může přinést málo prijatých tokenů.
Potřebuje draft model stejný tokenizer?
Najjednoduchšie implementace ano, protože tokeny se přímo overují. Existují i složitější metody pro odlišné tokenizéry, ale vyžadují mapování a dodatočnou logiku.
Kdy je zrychlení največšie?
Když je inference velkého modelu pameťovo omezená, draft je výrazně lacnejší a jeho návrhy mají vysokou míru prijatia. Výsledek je třeba měřit na cílovém serveri.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Fast Inference from Transformers via Speculative Decoding Accelerating Large Language Model Decoding with Speculative Sampling
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
