Odborná definícia
Význam a odborné vymedzenie pojmu
Inference latency je čas od prijatia vstupu inferenčným systémom po dostupnosť požadovaného výstupu. Môže zahŕňať sieťový prenos, čakanie vo fronte, predspracovanie, načítanie dát, výpočet modelu, dekódovanie a serializáciu odpovede. Pri generatívnych modeloch sa osobitne meria time to first token a čas medzi ďalšími tokenmi, pretože používateľ vníma začiatok odpovede inak než jej úplné dokončenie. Priemer nestačí, dôležité sú percentily p95 a p99, ktoré zachytávajú pomalé požiadavky. Latencia závisí od veľkosti batchu, dĺžky vstupu, hardvéru, paralelizácie a aktuálneho zaťaženia.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Asistent môže väčšinu otázok vybaviť za jednu sekundu, ale každá stotá trvá desať sekúnd. Priemerná hodnota vyzerá prijateľne, no používatelia si zapamätajú práve zamrznuté požiadavky. Meranie preto rozdelí čas na čakanie, tokenizáciu, výpočet a prenos. Pri textovom modeli sa sleduje, kedy sa objaví prvé slovo a akou rýchlosťou pokračuje generovanie. Väčší batch zlepší využitie GPU, ale jednotlivá požiadavka môže dlhšie čakať vo fronte. Cieľ latencie sa preto nastavuje podľa interakcie, nie iba podľa maximálnej teoretickej priepustnosti.
Časté otázky
Otázky, ktoré spresňujú význam
Aký je rozdiel medzi latenciou a priepustnosťou?
Latencia meria čas jednej požiadavky, priepustnosť počet spracovaných vstupov alebo tokenov za čas. Optimalizácia jednej veličiny môže zhoršiť druhú, napríklad väčšie dávky zvyšujú throughput, ale pridávajú čakanie.
Prečo sa reportuje p95 alebo p99?
Percentil ukazuje hranicu, pod ktorou skončí 95 alebo 99 percent požiadaviek. Odhaľuje dlhý chvost spôsobený frontami, studeným štartom, rozdielnou dĺžkou vstupu alebo súperením o zdroje.
Čo je time to first token?
Je čas od odoslania promptu po prvý vygenerovaný token. Ovplyvňuje ho spracovanie celého vstupného kontextu, plánovanie požiadavky a prípadné načítanie modelu.
Ako dĺžka kontextu mení latenciu?
Dlhší vstup zvyšuje prefill výpočet a pamäť pozornosti. Pri autoregresívnom dekódovaní rastie aj objem KV cache, čo môže obmedziť počet súbežných používateľov.
Čo je cold start?
Je oneskorenie pri spustení novej repliky, načítaní váh a inicializácii runtime. Objavuje sa po škálovaní z nuly alebo presune kontajnera a môže výrazne zhoršiť prvú požiadavku.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- MLCommons, MLPerf Inference Benchmark (mlcommons.org) NVIDIA Triton, Performance Analyzer (docs.nvidia.com)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
