Výkonnost nasadených modelů

Inference latency

Inference latency je čas od prijatia vstupu inferenčným systémem po dostupnost požadovaného výstupu. Může zahrnovat sieťový přenos, čakání ve fronte, předzpracování, načtení dat, výpočet modelu, dekódování a serializaci odpovědi. Při generativních modelech se zvlášť měří time to first token a čas mezi ďalšími tokenmi, protože uživatel vníma začiatok odpovědi jinak než její úplné dokončení. Průměr nestačí, důležité jsou percentily p95 a p99, které zachycují pomalé požadavky. Latence závisí na velikosti batchu, délky vstupu, hardwaru, paralelizace a aktuálního zaťažení.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-17

Odborná definice

Odborná definice

Inference latency je čas od prijatia vstupu inferenčným systémem po dostupnost požadovaného výstupu. Může zahrnovat sieťový přenos, čakání ve fronte, předzpracování, načtení dat, výpočet modelu, dekódování a serializaci odpovědi. Při generativních modelech se zvlášť měří time to first token a čas mezi ďalšími tokenmi, protože uživatel vníma začiatok odpovědi jinak než její úplné dokončení. Průměr nestačí, důležité jsou percentily p95 a p99, které zachycují pomalé požadavky. Latence závisí na velikosti batchu, délky vstupu, hardwaru, paralelizace a aktuálního zaťažení.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Asistent může večšinu otázek vybavit za jednu sekundu, ale každá stotá trvá deset sekúnd. Průměrná hodnota vypadá prijatelne, ale uživatelé si zapametají právě zamrznuté požadavky. Měření proto rozdělí čas na čakání, tokenizaci, výpočet a přenos. Při textovom modeli se sleduje, kdy se objeví první slovo a akou rýchlosťou pokračuje generování. Větší batch zlepší využití GPU, ale jednotlivá požadavek může déle čekat ve fronte. Cíl latence se proto nastavuje podle interakce, ne pouze podle maximálnej teoretickej propustnosti.

Časté otázky

Časté otázky

Jaký je rozdíl mezi latencí a priepustností?

Latence měří čas jedné požadavky, propustnost počet spracovaných vstupů nebo tokenů za čas. Optimalizace jedné veličiny může zhoršit druhou, například větší dávky zvyšují throughput, ale přidávají čakání.

Proč se reportuje p95 nebo p99?

Percentil ukazuje hranici, pod kterou skončí 95 nebo 99 procent požadavků. Odhaluje dlouhý ocas spůsobený frontami, studeným štartom, rozdielnou délkou vstupu nebo súperením o zdroje.

Co je time to first token?

Je čas od odoslání promptu po první vygenerovaný token. Ovlivňuje ho zpracování celého vstupního kontextu, plánování požadavky a prípadné načtení modelu.

Jako délka kontextu mění latenci?

Dlhší vstup zvyšuje prefill výpočet a paměť pozornosti. Při autoregresivním dekódování roste i objem KV cache, co může omezit počet súbežných uživatelů.

Co je cold start?

Je zpoždění při spustení nové repliky, načítaní váh a inicializaci runtime. Objevuje se po škálování z nuly nebo presune kontajnera a může výrazně zhoršit prvú požadavek.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • MLCommons, MLPerf Inference Benchmark (mlcommons.org) NVIDIA Triton, Performance Analyzer (docs.nvidia.com)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.