Odborná definice
Odborná definice
Key-value cache, KV cache, v transformerovom dekódování uchovává key a value tenzory vypočítané v attention vrstvách pro předchozí tokeny. Při generování dalšího tokenu model znovu počítá reprezentaci nového tokenu, ale nemusí prepočítavat K a V celé minulosti. Tím snižuje opakovanou práci a zrýchluje sekvenční dekódování. Paměť roste s počtem vrstev, délkou kontextu, počtem hláv, rozmerom a batchom, proto může být hlavním limitem servingu. Cache nemění pravděpodobnostní model odpovědi, pokud je implementovaná přesně a bez kvantizačnej odchylky.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Model vytváří odpověď token po tokene. Bez cache by při tokenech číslo 501 znovu spracoval attention informace pro prvních 500 tokenů, ačkoli se nezmenili. KV cache si medzivýsledky odloží a doplní pouze nový řádek. Odpověď vzniká rychleji, ale každá dlhá konverzace drží v GPU pameti vlastní rastúci blok. Při velkém počtu uživatelů může systém dříve narazit na kapacitu cache než na samotné parametry modelu. Provoz proto plánuje tokenový rozpočet a počet súbežných relací jako společný kapacitný problém.
Časté otázky
Časté otázky
Proč cache uchovává právě keys a values?
Attention pro nový query vektor potřebuje porovnání se všemi minulými keys a váženou kombinaci minulých values. Tyto tenzory se pro už spracované tokeny nemění, takže jejich lze bezpečně znovu použít.
Jako KV cache ovlivňuje latenci?
Výrazně snižuje výpočty během decode fáze, zejména při dlhšom kontextu. Prefill stále zpracovává celý vstup paralelně. Reálný zisk závisí na pameťovej propustnosti, batchingu a implementace attention.
Proč může být cache pameťovým bottleneckom?
Velikost roste lineární s uloženými tokenmi a počtem paralelných sekvencí. Při velkých modelech může cache na jednu požadavek zabrat stovky megabajtů, proto se používá kvantizace, offloading nebo paged attention.
Co je cache eviction?
Pravidlo, které odstraňuje starší nebo méně důležité položky, když se překročí rozpočet. Při transformerovom kontextu může vyhodení tokenů změnit odpověď, proto se používají posuvné okna nebo specializované kompresné strategie.
Lze KV cache zdielat mezi požiadavkami?
Při identickom prefixe lze prefixové K a V znovu použít, pokud se zhoduje model, tokenizer, pozice a konfigurace. Sdílení vyžaduje izolaci uživatelů, správu životnosti a ochranu před únikom obsahu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Hugging Face, Cache strategies
- Hugging Face, Caching explanation
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
