Optimalizace inference

Kvantizace po tréninku

Post-training quantization, zkráceně PTQ, převádí už natrénovaný model z vyššej numerické přesnosti na menší počet bitů bez plného opakovaného tréninku. Může kvantizovat pouze váhy nebo i aktivace, staticky pomocí kalibračných dat či dynamicky během inference. Převod používá scale, zero point nebo skupinové schémata, aby mapoval reálně hodnoty na diskrétní úrovně. PTQ snižuje paměť, přenos dat a někdy latenci, ale chyba zaokrúhlení může poškodit citlivé vrstvy. Skutečné zrychlení závisí na hardwaru, kernelů a formátu modelu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-10

Odborná definice

Odborná definice

Post-training quantization, zkráceně PTQ, převádí už natrénovaný model z vyššej numerické přesnosti na menší počet bitů bez plného opakovaného tréninku. Může kvantizovat pouze váhy nebo i aktivace, staticky pomocí kalibračných dat či dynamicky během inference. Převod používá scale, zero point nebo skupinové schémata, aby mapoval reálně hodnoty na diskrétní úrovně. PTQ snižuje paměť, přenos dat a někdy latenci, ale chyba zaokrúhlení může poškodit citlivé vrstvy. Skutečné zrychlení závisí na hardwaru, kernelů a formátu modelu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Model uložený v FP32 může mít štyrikrát větší pameťovou stopu než jeho INT8 verze. PTQ vytvoří menší artefakt až po skončení učení a na kalibračnej vzorku zistí rozsahy aktivací. Pokud vzorek neobsahuje vzácné, ale důležité vstupy, zvolený rozsah může tyto hodnoty orezat a kvalita klesne právě v kritickom scenári. Menší soubor také automaticky nezaručuje rýchlejšiu službu, když runtime musí hodnoty často dekvantizovat nebo procesor nemá optimalizované nízkobitové operace.

Časté otázky

Časté otázky

Jaký je rozdíl mezi PTQ a quantization-aware training?

PTQ kvantizuje hotový model s minimálnym nebo žiadnym doučením. QAT simuluje kvantizačnou chybu během tréninku, takže model se její může přizpůsobit, ale vyžaduje více práce a dat.

Na co slouží kalibračný dataset?

Odhaduje rozsahy a statistiky aktivací pro statickou kvantizaci. Má reprezentovat reálně vstupy, ale nepotřebuje nevyhnutelně labely, pokud se pouze zbierají aktivační rozsahy.

Co je weight-only quantization?

Snižuje přesnost modelových váh, zatímco aktivace zůstávají ve vyššom formáte. Je praktická při velkých jazykových modelech, kde paměť a přenos váh tvoří velkou část nákladů.

Proč některé vrstvy ostávají ve vyššej přesnosti?

Výstupní projekce, normalizace nebo vrstvy s outliermi mohou být citlivé na zaokrúhlení. Mixed-precision schéma chrání kvalitu a kvantizuje pouze vhodné části.

Jak se PTQ validuje?

Porovnává se úlohová kvalita, kalibrace, latence, throughput, paměť a spotreba na cílovém hardwaru. Kontroluje se i výkon kritických segmentů, ne pouze průměrný benchmark.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • PyTorch, Quantization API
  • PyTorch, Quantization in practice

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.