Nasadenie a MLOps · Kompresia a efektívna inferencia

Kvantizácia modelu

Quantization

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-07

Odborná definícia

Význam a odborné vymedzenie pojmu

Quantization je mapovanie hodnôt s vysokou alebo spojitou presnosťou na menšiu konečnú množinu reprezentovateľných úrovní. Pri neurónových sieťach sa kvantizujú váhy, aktivácie alebo medzivýsledky, napríklad z float32 na int8 alebo 4-bitový formát. Lineárna kvantizácia používa mierku a často nulový bod; môže byť symetrická, asymetrická, per-tensor alebo per-channel. Zníženie bitovej šírky šetrí pamäť a prenosy, no pridáva zaokrúhľovaciu a saturujúcu chybu a vyžaduje podporu cieľových kernelov.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Predstavte si meranie dĺžky pravítkom, ktoré má iba celé milimetre. Hodnota 12,37 mm sa musí uložiť ako najbližší dostupný stupeň. Jemnejšie pravítko je presnejšie, ale potrebuje viac bitov. Pri modeli sa takto zaokrúhľujú milióny čísel. Ak je rozsah zvolený zle, veľké hodnoty sa orežú a malé sa zlejú do rovnakej úrovne. Úspora v súbore preto sama nehovorí, či sa zrýchli reálna aplikácia alebo zachová kvalita.

Časté otázky

Otázky, ktoré spresňujú význam

Čo určuje scale a zero point?

Scale prevádza vzdialenosť medzi kvantizačnými úrovňami a reálnymi hodnotami. Zero point zabezpečuje reprezentáciu reálnej nuly pri asymetrickom rozsahu.

Čo znamená per-channel quantization?

Každý výstupný kanál, prípadne iná os, má vlastnú mierku. Lepšie zachytí rozdielne rozsahy, ale zvyšuje zložitosť.

Je 4-bit vždy dvakrát menší než 8-bit?

Nie v celom artefakte. Metadáta, škály, nekvantizované vrstvy a formát balenia menia výslednú veľkosť.

Ako sa meria kvantizačná chyba?

Porovnaním tenzorov, vrstiev a finálnych metrík. Malá priemerná chyba váh nemusí znamenať malý dopad na výstup.

Prečo sa model nemusí zrýchliť?

Niektoré operácie nemajú nízkobitový kernel, prechádzajú späť do float formátu alebo výkon obmedzuje presun dát a nie aritmetika.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Jacob et al., Quantization and Training of Neural Networks, 2018
  • TensorFlow Model Optimization, Quantization

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.