Odborná definice
Odborná definice
Weight quantization je reprezentování parametrů modelu menším počtem bitů než při původním formáte s plávajúcou desatinnou čárkou. Reálně váhy se mapují na diskrétnu mriežku pomocí scale faktora, případně zero-pointu, přičemž schéma může být symetrická nebo asymetrická, per-tensor nebo per-channel. Post-training quantization upravuje hotový model, quantization-aware training simuluje chybu už během učení. Úspora úložiště je predvídatelná, ale zrychlení závisí na podporovaných kernelů, dekvantizace, aktivací a cílového hardwaru. Nízký bitový rozsah může poškodit citlivé vrstvy nebo odlehlé hodnoty.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Místo uložení každé váhy jako presného 32-bitového čísla vytvoríte menší sadu povolených úrovní, například 256 hodnot při INT8. Každý parameter se zaokrúhli na najbližší stupeň a při výpočtu se použije měřítko, která ho priblíži původní hodnote. Model zaberie méně paměti a procesor může provést více operací najednou. Za úsporu se platí kvantizačnou chybou. Pokud jedna vrstva obsahuje běžné hodnoty i extrémně outliery, společná mriežka může být příliš hrubá, proto pomáhá per-channel škálování nebo zmiešaná přesnost.
Časté otázky
Časté otázky
Co znamená INT8 weight quantization?
Každá skupina váh se zakóduje do ůsmich bitů spolu s parametry škálování. Samotné výpočty mohou používat INT8, vyšší akumulaci nebo dočasnou dekvantizaci.
Jak se liší PTQ od QAT?
Post-training quantization kalibruje nebo přepočítá už natrénovaný model. Quantization-aware training vkladá simulované zaokrúhlování do tréninku, aby se parametry chybě prispůsobili.
Proč může 4-bitový model fungovat dobře?
Velké modely mají redundanci a váhy nemusí vyžadovat stejnou přesnost. Úspěch však závisí na kvantizéra, skupinovej velikosti, outlierů a cílové úlohy.
Je menší soubor vždy rychlejší?
Ne. Runtime musí mít optimalizované low-bit kernely. Při nevhodném hardwaru mohou prevody formátu nebo chýbajúca vektorizace zmazat výhodu.
Co je třeba po kvantizaci testovat?
Kvalitu podle úlohy, kalibraci, citlivé podskupiny dat, maximálnu paměť, latenci při různých batchoch a přesný exportný formát na cílovém zařízení.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- PyTorch, Quantization documentation Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
