Odborná definícia
Význam a odborné vymedzenie pojmu
Batch inference je režim, v ktorom model spracuje väčší súbor vstupov mimo interaktívnej požiadavky, zvyčajne podľa harmonogramu alebo po dostupnosti dát. Predikcie sa zapisujú do tabuľky, dátového skladu, súboru alebo frontu na ďalšie použitie. Dávková inferencia uprednostňuje priepustnosť, cenu a opakovateľnosť pred okamžitou odozvou. Pipeline musí riešiť verziu modelu, časový rez vstupov, idempotenciu, rozdelenie práce, obnovu po chybe a sledovanie toho, ku ktorému modelu a dátam každá predikcia patrí.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Poisťovňa môže každú noc prepočítať rizikové skóre pre celý kmeň klientov. Používateľ nečaká na odpoveď v reálnom čase, preto systém zoskupí milióny záznamov a využije výpočtové zdroje efektívnejšie. Výsledky sa uložia a aplikácia ich na druhý deň iba načíta. Výhodou je nižšia cena na predikciu a jednoduchšie škálovanie. Nevýhodou je zastaranie skóre medzi behmi a potreba presne evidovať, ktoré údaje boli dostupné v okamihu výpočtu, aby sa zabránilo úniku budúcich informácií.
Časté otázky
Otázky, ktoré spresňujú význam
Kedy je batch inference vhodnejšia než online inference?
Keď výsledok nemusí vzniknúť v milisekundách, vstupy prichádzajú vo väčších celkoch alebo sa predikcie pravidelne prepočítavajú. Typické sú nočné scoringy, spracovanie dokumentov, tvorba embeddingov a plánované forecasty.
Ako sa rieši zlyhanie uprostred dávky?
Pipeline má deliť prácu na identifikovateľné časti, ukladať stav a bezpečne opakovať iba nedokončené segmenty. Idempotentný zápis zabráni duplikátom. Chybné záznamy sa presunú do samostatnej fronty na diagnostiku.
Čo znamená data freshness pri dávkovej inferencii?
Vyjadruje, ako staré sú vstupy a výstupy v čase použitia. Denný model môže byť nevhodný pre podvod, ktorý sa mení v minútach. Frekvencia prepočtu sa volí podľa rýchlosti zmeny javu a ceny oneskorenia.
Treba monitorovať batch model aj bez API?
Áno. Sleduje sa úspešnosť behov, počet spracovaných záznamov, distribúcia vstupov, chýbajúce hodnoty, drift skóre, oneskorenie a kvalita po dostupnosti pravdy. Tichý výpadok dávky môže ovplyvniť tisíce rozhodnutí.
Ako sa zabráni zmiešaniu verzií modelu?
Každý výstup má niesť identifikátor modelu, dátum artefaktu, verziu feature pipeline a čas spracovania. Orchestrátor by mal pre jeden beh používať nemenný model. Pri opakovaní sa musí zachovať rovnaká konfigurácia alebo jasne vytvoriť nový beh.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Google Machine Learning Glossary
- NIST AI Risk Management Framework
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
