Odborná definice
Odborná definice
Inference latency je čas od prijatia vstupu inferenčným systémem po dostupnost požadovaného výstupu. Může zahrnovat sieťový přenos, čakání ve fronte, předzpracování, načtení dat, výpočet modelu, dekódování a serializaci odpovědi. Při generativních modelech se zvlášť měří time to first token a čas mezi ďalšími tokenmi, protože uživatel vníma začiatok odpovědi jinak než její úplné dokončení. Průměr nestačí, důležité jsou percentily p95 a p99, které zachycují pomalé požadavky. Latence závisí na velikosti batchu, délky vstupu, hardwaru, paralelizace a aktuálního zaťažení.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Asistent může večšinu otázek vybavit za jednu sekundu, ale každá stotá trvá deset sekúnd. Průměrná hodnota vypadá prijatelne, ale uživatelé si zapametají právě zamrznuté požadavky. Měření proto rozdělí čas na čakání, tokenizaci, výpočet a přenos. Při textovom modeli se sleduje, kdy se objeví první slovo a akou rýchlosťou pokračuje generování. Větší batch zlepší využití GPU, ale jednotlivá požadavek může déle čekat ve fronte. Cíl latence se proto nastavuje podle interakce, ne pouze podle maximálnej teoretickej propustnosti.
Časté otázky
Časté otázky
Jaký je rozdíl mezi latencí a priepustností?
Latence měří čas jedné požadavky, propustnost počet spracovaných vstupů nebo tokenů za čas. Optimalizace jedné veličiny může zhoršit druhou, například větší dávky zvyšují throughput, ale přidávají čakání.
Proč se reportuje p95 nebo p99?
Percentil ukazuje hranici, pod kterou skončí 95 nebo 99 procent požadavků. Odhaluje dlouhý ocas spůsobený frontami, studeným štartom, rozdielnou délkou vstupu nebo súperením o zdroje.
Co je time to first token?
Je čas od odoslání promptu po první vygenerovaný token. Ovlivňuje ho zpracování celého vstupního kontextu, plánování požadavky a prípadné načtení modelu.
Jako délka kontextu mění latenci?
Dlhší vstup zvyšuje prefill výpočet a paměť pozornosti. Při autoregresivním dekódování roste i objem KV cache, co může omezit počet súbežných uživatelů.
Co je cold start?
Je zpoždění při spustení nové repliky, načítaní váh a inicializaci runtime. Objevuje se po škálování z nuly nebo presune kontajnera a může výrazně zhoršit prvú požadavek.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- MLCommons, MLPerf Inference Benchmark (mlcommons.org) NVIDIA Triton, Performance Analyzer (docs.nvidia.com)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
