Odborná definice
Odborná definice
Post-training quantization, zkráceně PTQ, převádí už natrénovaný model z vyššej numerické přesnosti na menší počet bitů bez plného opakovaného tréninku. Může kvantizovat pouze váhy nebo i aktivace, staticky pomocí kalibračných dat či dynamicky během inference. Převod používá scale, zero point nebo skupinové schémata, aby mapoval reálně hodnoty na diskrétní úrovně. PTQ snižuje paměť, přenos dat a někdy latenci, ale chyba zaokrúhlení může poškodit citlivé vrstvy. Skutečné zrychlení závisí na hardwaru, kernelů a formátu modelu.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Model uložený v FP32 může mít štyrikrát větší pameťovou stopu než jeho INT8 verze. PTQ vytvoří menší artefakt až po skončení učení a na kalibračnej vzorku zistí rozsahy aktivací. Pokud vzorek neobsahuje vzácné, ale důležité vstupy, zvolený rozsah může tyto hodnoty orezat a kvalita klesne právě v kritickom scenári. Menší soubor také automaticky nezaručuje rýchlejšiu službu, když runtime musí hodnoty často dekvantizovat nebo procesor nemá optimalizované nízkobitové operace.
Časté otázky
Časté otázky
Jaký je rozdíl mezi PTQ a quantization-aware training?
PTQ kvantizuje hotový model s minimálnym nebo žiadnym doučením. QAT simuluje kvantizačnou chybu během tréninku, takže model se její může přizpůsobit, ale vyžaduje více práce a dat.
Na co slouží kalibračný dataset?
Odhaduje rozsahy a statistiky aktivací pro statickou kvantizaci. Má reprezentovat reálně vstupy, ale nepotřebuje nevyhnutelně labely, pokud se pouze zbierají aktivační rozsahy.
Co je weight-only quantization?
Snižuje přesnost modelových váh, zatímco aktivace zůstávají ve vyššom formáte. Je praktická při velkých jazykových modelech, kde paměť a přenos váh tvoří velkou část nákladů.
Proč některé vrstvy ostávají ve vyššej přesnosti?
Výstupní projekce, normalizace nebo vrstvy s outliermi mohou být citlivé na zaokrúhlení. Mixed-precision schéma chrání kvalitu a kvantizuje pouze vhodné části.
Jak se PTQ validuje?
Porovnává se úlohová kvalita, kalibrace, latence, throughput, paměť a spotreba na cílovém hardwaru. Kontroluje se i výkon kritických segmentů, ne pouze průměrný benchmark.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- PyTorch, Quantization API
- PyTorch, Quantization in practice
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
