Trénování a optimalizace · Optimalizace inference

Kvantizace po tréninku

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-10

Odborná definice

Význam a odborné vymezení pojmu

Post-training quantization, zkráceně PTQ, převádí už natrénovaný model z vyššej numerické přesnosti na menší počet bitů bez plného opakovaného tréninku. Může kvantizovat pouze váhy nebo i aktivace, staticky pomocí kalibračných dat či dynamicky během inference. Převod používá scale, zero point nebo skupinové schémata, aby mapoval reálně hodnoty na diskrétní úrovně. PTQ snižuje paměť, přenos dat a někdy latenci, ale chyba zaokrúhlení může poškodit citlivé vrstvy. Skutečné zrychlení závisí na hardwaru, kernelů a formátu modelu.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Model uložený v FP32 může mít štyrikrát větší pameťovou stopu než jeho INT8 verze. PTQ vytvoří menší artefakt až po skončení učení a na kalibračnej vzorku zistí rozsahy aktivací. Pokud vzorek neobsahuje vzácné, ale důležité vstupy, zvolený rozsah může tyto hodnoty orezat a kvalita klesne právě v kritickom scenári. Menší soubor také automaticky nezaručuje rýchlejšiu službu, když runtime musí hodnoty často dekvantizovat nebo procesor nemá optimalizované nízkobitové operace.

Časté otázky

Otázky, které upřesňují význam

Jaký je rozdíl mezi PTQ a quantization-aware training?

PTQ kvantizuje hotový model s minimálnym nebo žiadnym doučením. QAT simuluje kvantizačnou chybu během tréninku, takže model se její může přizpůsobit, ale vyžaduje více práce a dat.

Na co slouží kalibračný dataset?

Odhaduje rozsahy a statistiky aktivací pro statickou kvantizaci. Má reprezentovat reálně vstupy, ale nepotřebuje nevyhnutelně labely, pokud se pouze zbierají aktivační rozsahy.

Co je weight-only quantization?

Snižuje přesnost modelových váh, zatímco aktivace zůstávají ve vyššom formáte. Je praktická při velkých jazykových modelech, kde paměť a přenos váh tvoří velkou část nákladů.

Proč některé vrstvy ostávají ve vyššej přesnosti?

Výstupní projekce, normalizace nebo vrstvy s outliermi mohou být citlivé na zaokrúhlení. Mixed-precision schéma chrání kvalitu a kvantizuje pouze vhodné části.

Jak se PTQ validuje?

Porovnává se úlohová kvalita, kalibrace, latence, throughput, paměť a spotreba na cílovém hardwaru. Kontroluje se i výkon kritických segmentů, ne pouze průměrný benchmark.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • PyTorch, Quantization API
  • PyTorch, Quantization in practice

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.