Modely a architektúry · Použitie natrénovaného modelu

Inferencia modelu

Inference

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-15

Odborná definícia

Význam a odborné vymedzenie pojmu

Inference je výpočtová fáza, v ktorej natrénovaný model spracuje nový vstup a vytvorí predikciu, embedding, generovaný obsah alebo rozhodovacie skóre bez aktualizácie svojich naučených parametrov. Zahŕňa predspracovanie, dopredný priechod modelom, dekódovanie a následné pravidlá, ktoré prevádzajú surový výstup na použiteľný výsledok. Pri jazykovom modeli prebieha autoregresívne, token po tokene, pri klasifikátore môže ísť o jediný priechod. Inference sa líši od tréningu požiadavkami na latenciu, dostupnosť, pamäť a reprodukovateľnosť. Správnosť závisí aj od verzie tokenizeru, vstupnej schémy a postprocessingu.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Počas tréningu sa model učí z množstva označených snímok a upravuje svoje váhy. Keď potom používateľ nahrá novú fotografiu, systém už váhy nemení. Obrázok zmenší, normalizuje, pošle cez sieť a vráti skóre tried. Celý tento prevádzkový krok je inference. Pri chatbote sa výpočet opakuje pre každý ďalší token, preto dlhá odpoveď potrebuje viac času než krátky štítok. Aj keď je model rovnaký, chybná normalizácia alebo iný tokenizer môže zmeniť výsledok. Nasadenie preto verzovaním spája artefakt modelu so všetkými vstupnými a výstupnými transformáciami.

Časté otázky

Otázky, ktoré spresňujú význam

Menia sa počas inference váhy modelu?

Za štandardných podmienok nie. Parametre zostávajú fixné a model iba počíta výstup. Adaptívne systémy môžu spúšťať samostatnú aktualizáciu, tá však patrí do učenia alebo fine tuningu.

Čo je batch inference?

Systém spracuje väčšiu množinu vstupov naraz alebo podľa harmonogramu, napríklad nočné skórovanie databázy. Uprednostňuje priepustnosť a cenu pred okamžitou odozvou.

Ako sa líši online inference?

Požiadavka prichádza interaktívne a odpoveď sa očakáva v krátkom čase. Architektúra musí riešiť špičky, timeouty, škálovanie a stabilnú latenciu pre jednotlivých používateľov.

Prečo jazykový model potrebuje KV cache?

Ukladá kľúče a hodnoty pozornosti z predchádzajúcich tokenov, aby sa pri generovaní neopakoval celý výpočet histórie. Znižuje čas, ale spotrebuje pamäť úmernú dĺžke kontextu.

Čo treba verzovať spolu s modelom?

Tokenizer, slovníky, normalizáciu, poradie príznakov, prah, dekódovanie, knižnice a hardvérové nastavenia. Samotný súbor váh nestačí na reprodukciu produkčného výsledku.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Google Machine Learning Glossary, inference (developers.google.com) NVIDIA Triton Inference Server documentation (docs.nvidia.com)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.