Trénování a optimalizace · Optimalizace autoregresívnej inference

Vyrovnávace paměť klúčů a hodnot

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-K-16

Odborná definice

Význam a odborné vymezení pojmu

Key-value cache, KV cache, v transformerovom dekódování uchovává key a value tenzory vypočítané v attention vrstvách pro předchozí tokeny. Při generování dalšího tokenu model znovu počítá reprezentaci nového tokenu, ale nemusí prepočítavat K a V celé minulosti. Tím snižuje opakovanou práci a zrýchluje sekvenční dekódování. Paměť roste s počtem vrstev, délkou kontextu, počtem hláv, rozmerom a batchom, proto může být hlavním limitem servingu. Cache nemění pravděpodobnostní model odpovědi, pokud je implementovaná přesně a bez kvantizačnej odchylky.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Model vytváří odpověď token po tokene. Bez cache by při tokenech číslo 501 znovu spracoval attention informace pro prvních 500 tokenů, ačkoli se nezmenili. KV cache si medzivýsledky odloží a doplní pouze nový řádek. Odpověď vzniká rychleji, ale každá dlhá konverzace drží v GPU pameti vlastní rastúci blok. Při velkém počtu uživatelů může systém dříve narazit na kapacitu cache než na samotné parametry modelu. Provoz proto plánuje tokenový rozpočet a počet súbežných relací jako společný kapacitný problém.

Časté otázky

Otázky, které upřesňují význam

Proč cache uchovává právě keys a values?

Attention pro nový query vektor potřebuje porovnání se všemi minulými keys a váženou kombinaci minulých values. Tyto tenzory se pro už spracované tokeny nemění, takže jejich lze bezpečně znovu použít.

Jako KV cache ovlivňuje latenci?

Výrazně snižuje výpočty během decode fáze, zejména při dlhšom kontextu. Prefill stále zpracovává celý vstup paralelně. Reálný zisk závisí na pameťovej propustnosti, batchingu a implementace attention.

Proč může být cache pameťovým bottleneckom?

Velikost roste lineární s uloženými tokenmi a počtem paralelných sekvencí. Při velkých modelech může cache na jednu požadavek zabrat stovky megabajtů, proto se používá kvantizace, offloading nebo paged attention.

Co je cache eviction?

Pravidlo, které odstraňuje starší nebo méně důležité položky, když se překročí rozpočet. Při transformerovom kontextu může vyhodení tokenů změnit odpověď, proto se používají posuvné okna nebo specializované kompresné strategie.

Lze KV cache zdielat mezi požiadavkami?

Při identickom prefixe lze prefixové K a V znovu použít, pokud se zhoduje model, tokenizer, pozice a konfigurace. Sdílení vyžaduje izolaci uživatelů, správu životnosti a ochranu před únikom obsahu.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Hugging Face, Cache strategies
  • Hugging Face, Caching explanation

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.