Odborná definícia
Odborná definícia
Post-training quantization, skrátene PTQ, prevádza už natrénovaný model z vyššej numerickej presnosti na menší počet bitov bez plného opakovaného tréningu. Môže kvantizovať iba váhy alebo aj aktivácie, staticky pomocou kalibračných dát či dynamicky počas inference. Prevod používa scale, zero point alebo skupinové schémy, aby mapoval reálne hodnoty na diskrétne úrovne. PTQ znižuje pamäť, prenos dát a niekedy latenciu, no chyba zaokrúhlenia môže poškodiť citlivé vrstvy. Skutočné zrýchlenie závisí od hardvéru, kernelov a formátu modelu.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Model uložený v FP32 môže mať štyrikrát väčšiu pamäťovú stopu než jeho INT8 verzia. PTQ vytvorí menší artefakt až po skončení učenia a na kalibračnej vzorke zistí rozsahy aktivácií. Ak vzorka neobsahuje zriedkavé, ale dôležité vstupy, zvolený rozsah môže tieto hodnoty orezať a kvalita klesne práve v kritickom scenári. Menší súbor tiež automaticky nezaručuje rýchlejšiu službu, keď runtime musí hodnoty často dekvantizovať alebo procesor nemá optimalizované nízkobitové operácie.
Časté otázky
Časté otázky
Aký je rozdiel medzi PTQ a quantization-aware training?
PTQ kvantizuje hotový model s minimálnym alebo žiadnym doučením. QAT simuluje kvantizačnú chybu počas tréningu, takže model sa jej môže prispôsobiť, no vyžaduje viac práce a dát.
Na čo slúži kalibračný dataset?
Odhaduje rozsahy a štatistiky aktivácií pre statickú kvantizáciu. Má reprezentovať reálne vstupy, ale nepotrebuje nevyhnutne labely, ak sa iba zbierajú aktivačné rozsahy.
Čo je weight-only quantization?
Znižuje presnosť modelových váh, zatiaľ čo aktivácie zostávajú vo vyššom formáte. Je praktická pri veľkých jazykových modeloch, kde pamäť a prenos váh tvoria veľkú časť nákladov.
Prečo niektoré vrstvy ostávajú vo vyššej presnosti?
Výstupné projekcie, normalizácie alebo vrstvy s outliermi môžu byť citlivé na zaokrúhlenie. Mixed-precision schéma chráni kvalitu a kvantizuje iba vhodné časti.
Ako sa PTQ validuje?
Porovnáva sa úlohová kvalita, kalibrácia, latencia, throughput, pamäť a spotreba na cieľovom hardvéri. Kontroluje sa aj výkon kritických segmentov, nie iba priemerný benchmark.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- PyTorch, Quantization API
- PyTorch, Quantization in practice
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
