Inferenční infrastruktura

Dynamické dávkování

Dynamické dávkování je technika serverování modelů, při které se samostatné inferenční požadavky na krátký čas zhromaždia a spoja do jedné výpočetní dávky. Server průběžně volí velikost dávky podle príchodů, maximálnej čakacej doby, délky vstupů a dostupnej paměti. Cílem je zvýšit propustnost a využití akcelerátora bez nepřiměřeného nárastu latence. Při sekvenčních modelech musí systém řešit padding, rozdielnu délku generování, priority a férovost mezi krátkymi a dlhými požiadavkami.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-25

Odborná definice

Odborná definice

Dynamické dávkování je technika serverování modelů, při které se samostatné inferenční požadavky na krátký čas zhromaždia a spoja do jedné výpočetní dávky. Server průběžně volí velikost dávky podle príchodů, maximálnej čakacej doby, délky vstupů a dostupnej paměti. Cílem je zvýšit propustnost a využití akcelerátora bez nepřiměřeného nárastu latence. Při sekvenčních modelech musí systém řešit padding, rozdielnu délku generování, priority a férovost mezi krátkymi a dlhými požiadavkami.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

GPU zpracuje matici mnoha požadavků efektivněji než sériu jednotlivých malých výpočtů. Dynamické dávkování proto chvílu počká, spojí současně prichádzajúce požadavky a odošle jejich modelu najednou. Čakání však nesmí být příliš dlouhé, jinak uživatel pocíti zpoždění. Při generování textu je situace zložitejšia, protože jedna odpověď skončí po desiatich tokenech a jiná po tisícke. Moderný serving proto průběžně doplňa a uvolňuje pozice v dávce.

Časté otázky

Časté otázky

Jako dynamické dávkování zvyšuje výkon?

Snižuje režijné náklady na jednu požadavek a lépe využívá paralelní maticové operace akcelerátora, čím roste počet spracovaných vstupů za sekundu.

Jaký je kompromis mezi latencí a priepustností?

Déle čakání umožní větší dávku a vyšší propustnost, ale zvyšuje čas odpovědi. Limit se volí podle SLA a vzoru provozu.

Co je continuous batching?

Při generování sekvencí server průběžně přidává nové požadavky do uvolnených miest místo čakání, zatímco skončí celá původná dávka.

Proč se vstupy zoskupují podle délky?

Podobné délky snižují padding a nevyužité výpočty. Při velmi rozdielnych vstupech krátké požadavky platí náklady za najdlhšiu položku v dávce.

Může dávkování poškodit prioritu kritické požadavky?

Ano. Serving musí podporovat priority, maximálnu čakaci dobu a oddělené fronty, aby objemné úlohy neblokovali časovo citlivé rozhodnutí.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.