Nasadenie a MLOps · Výkonnosť nasadených modelov

Latencia inferencie

Inference latency

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-17

Odborná definícia

Význam a odborné vymedzenie pojmu

Inference latency je čas od prijatia vstupu inferenčným systémom po dostupnosť požadovaného výstupu. Môže zahŕňať sieťový prenos, čakanie vo fronte, predspracovanie, načítanie dát, výpočet modelu, dekódovanie a serializáciu odpovede. Pri generatívnych modeloch sa osobitne meria time to first token a čas medzi ďalšími tokenmi, pretože používateľ vníma začiatok odpovede inak než jej úplné dokončenie. Priemer nestačí, dôležité sú percentily p95 a p99, ktoré zachytávajú pomalé požiadavky. Latencia závisí od veľkosti batchu, dĺžky vstupu, hardvéru, paralelizácie a aktuálneho zaťaženia.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Asistent môže väčšinu otázok vybaviť za jednu sekundu, ale každá stotá trvá desať sekúnd. Priemerná hodnota vyzerá prijateľne, no používatelia si zapamätajú práve zamrznuté požiadavky. Meranie preto rozdelí čas na čakanie, tokenizáciu, výpočet a prenos. Pri textovom modeli sa sleduje, kedy sa objaví prvé slovo a akou rýchlosťou pokračuje generovanie. Väčší batch zlepší využitie GPU, ale jednotlivá požiadavka môže dlhšie čakať vo fronte. Cieľ latencie sa preto nastavuje podľa interakcie, nie iba podľa maximálnej teoretickej priepustnosti.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi latenciou a priepustnosťou?

Latencia meria čas jednej požiadavky, priepustnosť počet spracovaných vstupov alebo tokenov za čas. Optimalizácia jednej veličiny môže zhoršiť druhú, napríklad väčšie dávky zvyšujú throughput, ale pridávajú čakanie.

Prečo sa reportuje p95 alebo p99?

Percentil ukazuje hranicu, pod ktorou skončí 95 alebo 99 percent požiadaviek. Odhaľuje dlhý chvost spôsobený frontami, studeným štartom, rozdielnou dĺžkou vstupu alebo súperením o zdroje.

Čo je time to first token?

Je čas od odoslania promptu po prvý vygenerovaný token. Ovplyvňuje ho spracovanie celého vstupného kontextu, plánovanie požiadavky a prípadné načítanie modelu.

Ako dĺžka kontextu mení latenciu?

Dlhší vstup zvyšuje prefill výpočet a pamäť pozornosti. Pri autoregresívnom dekódovaní rastie aj objem KV cache, čo môže obmedziť počet súbežných používateľov.

Čo je cold start?

Je oneskorenie pri spustení novej repliky, načítaní váh a inicializácii runtime. Objavuje sa po škálovaní z nuly alebo presune kontajnera a môže výrazne zhoršiť prvú požiadavku.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • MLCommons, MLPerf Inference Benchmark (mlcommons.org) NVIDIA Triton, Performance Analyzer (docs.nvidia.com)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.