Kontext, náklady a řízení požadavků

rozpočet tokenů

Token budget je plánovaný nebo technicky vynútený počet tokenů dostupných pro vstup, systémové instrukce, historii, retrieval, nástroje a generovaný výstup v jedné požadavku nebo procese. Musí respektovat kontextové okno modelu, rezervu na odpověď a prípadné interní formáty. Rozpočet ovlivňuje náklady, latenci a kvalitu kontextu. Jeho překročení může vést k odmietnutiu, orezání skorších správ nebo strate podstatných důkazů. Rozpočet se testuje i při najdlhšej histórii, največšom retrieval výsledku a maximálnom povolenom výstupu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-T-16

Odborná definice

Odborná definice

Token budget je plánovaný nebo technicky vynútený počet tokenů dostupných pro vstup, systémové instrukce, historii, retrieval, nástroje a generovaný výstup v jedné požadavku nebo procese. Musí respektovat kontextové okno modelu, rezervu na odpověď a prípadné interní formáty. Rozpočet ovlivňuje náklady, latenci a kvalitu kontextu. Jeho překročení může vést k odmietnutiu, orezání skorších správ nebo strate podstatných důkazů. Rozpočet se testuje i při najdlhšej histórii, največšom retrieval výsledku a maximálnom povolenom výstupu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si kufor s pevnou kapacitou. Systémový prompt, otázka, historie chatu, nájdené dokumenty i odpověď používají ten jistý prostor. Pokud retrieval vloží příliš mnoho úryvků, modelu zůstane málo místa na odpověď nebo se odstraní staršia informace. Dobrý návrh proto rezervuje výstup, zoraďuje důkazy podle významu, skracuje historii a měří tokeny konkrétnym tokenizérom. Najdlhší prompt není automaticky nejlepší, protože nadbytočný text může prekryť relevantní signál. Systém má uživateli oznámit, když musel skrátit podklady, místo tichého predstierání úplného kontextu.

Časté otázky

Časté otázky

Je token budget stejný jako context window?

Ne. Kontextové okno je maximálna kapacita modelu. Token budget je praktické rozdělení této kapacity mezi jednotlivé části požadavky a rezervu na výstup.

Co se stane při překročení limitu?

API může požadavek odmítnout, klient může vstup skrátit nebo systém odstraní starší správy. Chování musí být explicitní, aby se kritický kontext nestrácal potichu.

Jak se rozpočet prideluje RAG systému?

Určí se prostor pro otázku, instrukce a odpověď, zbytek se rozdělí mezi top-k úryvky. Chunky se mohou komprimovat, deduplikovat nebo rerankovat.

Proč je třeba rezervovat výstupní tokeny?

Pokud vstup zaplní celé okno, model nemá kapacitu dokončit odpověď. Rezerva se odvozuje od požadovaného formátu, délky a najhoršieho případu.

Jako token budget souvisí s cenou?

Mnohé služby účtují vstupní a výstupní tokeny zvlášť. Rozpočet proto slouží i jako finančný limit pro jednu požadavek, uživatele nebo workflow.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • OpenAI Tokenizer
  • Hugging Face Tokenizer documentation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.