Odborná definice
Odborná definice
Inference je výpočetní fáza, ve které natrénovaný model zpracuje nový vstup a vytvoří predikci, embedding, generovaný obsah nebo rozhodovací skóre bez aktualizace svojich naučených parametrů. Zahrnuje předzpracování, dopředný průchod modelem, dekódování a následné pravidla, které prevádzají surový výstup na použitelný výsledek. Při jazykovém modeli probíhá autoregresívne, token po tokene, při klasifikátore může jít o jediný průchod. Inference se liší od tréninku požiadavkami na latenci, dostupnost, paměť a reprodukovatelnost. Správnost závisí i od verze tokenizeru, vstupní schémata a postprocessingu.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Během tréninku se model učí z množství označených snímků a upravuje svoje váhy. Když potom uživatel nahrá novou fotografii, systém už váhy nemění. Obrázek zmenší, normalizuje, pošle přes síť a vrátí skóre tříd. Celý tento provozní krok je inference. Při chatbote se výpočet opakuje pro každý další token, proto dlhá odpověď potřebuje více času než krátký štítek. I když je model stejný, chybná normalizace nebo jiný tokenizer může změnit výsledek. Nasazení proto verzováním spojuje artefakt modelu se všemi vstupnými a výstupnými transformacemi.
Časté otázky
Časté otázky
Mění se během inference váhy modelu?
Za štandardných podmínek ne. Parametry zůstávají fixné a model pouze počítá výstup. Adaptivní systémy mohou spúšťat samostatnou aktualizaci, tá však patří do učení nebo fine tuningu.
Co je batch inference?
Systém zpracuje větší množinu vstupů najednou nebo podle harmonogramu, například nočné skórování databáze. Upřednostňuje propustnost a cenu před okamžitou odezvou.
Jak se liší online inference?
Požadavek prichádza interaktívne a odpověď se očekává v krátkom čase. Architektura musí řešit špičky, timeouty, škálování a stabilnou latenci pro jednotlivých uživatelů.
Proč jazykový model potřebuje KV cache?
Ukládá klúče a hodnoty pozornosti z předchozích tokenů, aby se při generování neopakoval celý výpočet historie. Snižuje čas, ale spotrebuje paměť úmernou dlžke kontextu.
Co je třeba verzovat spolu s modelem?
Tokenizer, slovníky, normalizaci, pořadí příznaků, práh, dekódování, knižnice a hardvérové nastavení. Samotný soubor váh nestačí na reprodukci produkčného výsledku.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Machine Learning Glossary, inference (developers.google.com) NVIDIA Triton Inference Server documentation (docs.nvidia.com)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
