Nasadenie a MLOps · Numerická kompresia modelov

Kvantizácia váh modelu

Weight quantization

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-15

Odborná definícia

Význam a odborné vymedzenie pojmu

Weight quantization je reprezentovanie parametrov modelu menším počtom bitov než pri pôvodnom formáte s plávajúcou desatinnou čiarkou. Reálne váhy sa mapujú na diskrétnu mriežku pomocou scale faktora, prípadne zero-pointu, pričom schéma môže byť symetrická alebo asymetrická, per-tensor alebo per-channel. Post-training quantization upravuje hotový model, quantization-aware training simuluje chybu už počas učenia. Úspora úložiska je predvídateľná, no zrýchlenie závisí od podporovaných kernelov, dekvantizácie, aktivácií a cieľového hardvéru. Nízky bitový rozsah môže poškodiť citlivé vrstvy alebo odľahlé hodnoty.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Namiesto uloženia každej váhy ako presného 32-bitového čísla vytvoríte menšiu sadu povolených úrovní, napríklad 256 hodnôt pri INT8. Každý parameter sa zaokrúhli na najbližší stupeň a pri výpočte sa použije mierka, ktorá ho priblíži pôvodnej hodnote. Model zaberie menej pamäte a procesor môže vykonať viac operácií naraz. Za úsporu sa platí kvantizačnou chybou. Ak jedna vrstva obsahuje bežné hodnoty aj extrémne outliery, spoločná mriežka môže byť príliš hrubá, preto pomáha per-channel škálovanie alebo zmiešaná presnosť.

Časté otázky

Otázky, ktoré spresňujú význam

Čo znamená INT8 weight quantization?

Každá skupina váh sa zakóduje do ôsmich bitov spolu s parametrami škálovania. Samotné výpočty môžu používať INT8, vyššiu akumuláciu alebo dočasnú dekvantizáciu.

Ako sa líši PTQ od QAT?

Post-training quantization kalibruje alebo prepočíta už natrénovaný model. Quantization-aware training vkladá simulované zaokrúhľovanie do tréningu, aby sa parametre chybe prispôsobili.

Prečo môže 4-bitový model fungovať dobre?

Veľké modely majú redundanciu a váhy nemusia vyžadovať rovnakú presnosť. Úspech však závisí od kvantizéra, skupinovej veľkosti, outlierov a cieľovej úlohy.

Je menší súbor vždy rýchlejší?

Nie. Runtime musí mať optimalizované low-bit kernely. Pri nevhodnom hardvéri môžu prevody formátu alebo chýbajúca vektorizácia zmazať výhodu.

Čo treba po kvantizácii testovať?

Kvalitu podľa úlohy, kalibráciu, citlivé podskupiny dát, maximálnu pamäť, latenciu pri rôznych batchoch a presný exportný formát na cieľovom zariadení.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • PyTorch, Quantization documentation Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.