Odborná definice
Význam a odborné vymezení pojmu
Post-training quantization, zkráceně PTQ, převádí už natrénovaný model z vyššej numerické přesnosti na menší počet bitů bez plného opakovaného tréninku. Může kvantizovat pouze váhy nebo i aktivace, staticky pomocí kalibračných dat či dynamicky během inference. Převod používá scale, zero point nebo skupinové schémata, aby mapoval reálně hodnoty na diskrétní úrovně. PTQ snižuje paměť, přenos dat a někdy latenci, ale chyba zaokrúhlení může poškodit citlivé vrstvy. Skutečné zrychlení závisí na hardwaru, kernelů a formátu modelu.
Srozumitelné vysvětlení
Jak se pojem používá v praxi
Model uložený v FP32 může mít štyrikrát větší pameťovou stopu než jeho INT8 verze. PTQ vytvoří menší artefakt až po skončení učení a na kalibračnej vzorku zistí rozsahy aktivací. Pokud vzorek neobsahuje vzácné, ale důležité vstupy, zvolený rozsah může tyto hodnoty orezat a kvalita klesne právě v kritickom scenári. Menší soubor také automaticky nezaručuje rýchlejšiu službu, když runtime musí hodnoty často dekvantizovat nebo procesor nemá optimalizované nízkobitové operace.
Časté otázky
Otázky, které upřesňují význam
Jaký je rozdíl mezi PTQ a quantization-aware training?
PTQ kvantizuje hotový model s minimálnym nebo žiadnym doučením. QAT simuluje kvantizačnou chybu během tréninku, takže model se její může přizpůsobit, ale vyžaduje více práce a dat.
Na co slouží kalibračný dataset?
Odhaduje rozsahy a statistiky aktivací pro statickou kvantizaci. Má reprezentovat reálně vstupy, ale nepotřebuje nevyhnutelně labely, pokud se pouze zbierají aktivační rozsahy.
Co je weight-only quantization?
Snižuje přesnost modelových váh, zatímco aktivace zůstávají ve vyššom formáte. Je praktická při velkých jazykových modelech, kde paměť a přenos váh tvoří velkou část nákladů.
Proč některé vrstvy ostávají ve vyššej přesnosti?
Výstupní projekce, normalizace nebo vrstvy s outliermi mohou být citlivé na zaokrúhlení. Mixed-precision schéma chrání kvalitu a kvantizuje pouze vhodné části.
Jak se PTQ validuje?
Porovnává se úlohová kvalita, kalibrace, latence, throughput, paměť a spotreba na cílovém hardwaru. Kontroluje se i výkon kritických segmentů, ne pouze průměrný benchmark.
Související pojmy
Významové a tematické souvislosti
Zdroje a redakční stopa
Použitá východiska a odborná revize
- PyTorch, Quantization API
- PyTorch, Quantization in practice
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
