Odborná definícia
Odborná definícia
Weight quantization je reprezentovanie parametrov modelu menším počtom bitov než pri pôvodnom formáte s plávajúcou desatinnou čiarkou. Reálne váhy sa mapujú na diskrétnu mriežku pomocou scale faktora, prípadne zero-pointu, pričom schéma môže byť symetrická alebo asymetrická, per-tensor alebo per-channel. Post-training quantization upravuje hotový model, quantization-aware training simuluje chybu už počas učenia. Úspora úložiska je predvídateľná, no zrýchlenie závisí od podporovaných kernelov, dekvantizácie, aktivácií a cieľového hardvéru. Nízky bitový rozsah môže poškodiť citlivé vrstvy alebo odľahlé hodnoty.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Namiesto uloženia každej váhy ako presného 32-bitového čísla vytvoríte menšiu sadu povolených úrovní, napríklad 256 hodnôt pri INT8. Každý parameter sa zaokrúhli na najbližší stupeň a pri výpočte sa použije mierka, ktorá ho priblíži pôvodnej hodnote. Model zaberie menej pamäte a procesor môže vykonať viac operácií naraz. Za úsporu sa platí kvantizačnou chybou. Ak jedna vrstva obsahuje bežné hodnoty aj extrémne outliery, spoločná mriežka môže byť príliš hrubá, preto pomáha per-channel škálovanie alebo zmiešaná presnosť.
Časté otázky
Časté otázky
Čo znamená INT8 weight quantization?
Každá skupina váh sa zakóduje do ôsmich bitov spolu s parametrami škálovania. Samotné výpočty môžu používať INT8, vyššiu akumuláciu alebo dočasnú dekvantizáciu.
Ako sa líši PTQ od QAT?
Post-training quantization kalibruje alebo prepočíta už natrénovaný model. Quantization-aware training vkladá simulované zaokrúhľovanie do tréningu, aby sa parametre chybe prispôsobili.
Prečo môže 4-bitový model fungovať dobre?
Veľké modely majú redundanciu a váhy nemusia vyžadovať rovnakú presnosť. Úspech však závisí od kvantizéra, skupinovej veľkosti, outlierov a cieľovej úlohy.
Je menší súbor vždy rýchlejší?
Nie. Runtime musí mať optimalizované low-bit kernely. Pri nevhodnom hardvéri môžu prevody formátu alebo chýbajúca vektorizácia zmazať výhodu.
Čo treba po kvantizácii testovať?
Kvalitu podľa úlohy, kalibráciu, citlivé podskupiny dát, maximálnu pamäť, latenciu pri rôznych batchoch a presný exportný formát na cieľovom zariadení.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- PyTorch, Quantization documentation Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
