Odborná definícia
Význam a odborné vymedzenie pojmu
Quantization je mapovanie hodnôt s vysokou alebo spojitou presnosťou na menšiu konečnú množinu reprezentovateľných úrovní. Pri neurónových sieťach sa kvantizujú váhy, aktivácie alebo medzivýsledky, napríklad z float32 na int8 alebo 4-bitový formát. Lineárna kvantizácia používa mierku a často nulový bod; môže byť symetrická, asymetrická, per-tensor alebo per-channel. Zníženie bitovej šírky šetrí pamäť a prenosy, no pridáva zaokrúhľovaciu a saturujúcu chybu a vyžaduje podporu cieľových kernelov.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Predstavte si meranie dĺžky pravítkom, ktoré má iba celé milimetre. Hodnota 12,37 mm sa musí uložiť ako najbližší dostupný stupeň. Jemnejšie pravítko je presnejšie, ale potrebuje viac bitov. Pri modeli sa takto zaokrúhľujú milióny čísel. Ak je rozsah zvolený zle, veľké hodnoty sa orežú a malé sa zlejú do rovnakej úrovne. Úspora v súbore preto sama nehovorí, či sa zrýchli reálna aplikácia alebo zachová kvalita.
Časté otázky
Otázky, ktoré spresňujú význam
Čo určuje scale a zero point?
Scale prevádza vzdialenosť medzi kvantizačnými úrovňami a reálnymi hodnotami. Zero point zabezpečuje reprezentáciu reálnej nuly pri asymetrickom rozsahu.
Čo znamená per-channel quantization?
Každý výstupný kanál, prípadne iná os, má vlastnú mierku. Lepšie zachytí rozdielne rozsahy, ale zvyšuje zložitosť.
Je 4-bit vždy dvakrát menší než 8-bit?
Nie v celom artefakte. Metadáta, škály, nekvantizované vrstvy a formát balenia menia výslednú veľkosť.
Ako sa meria kvantizačná chyba?
Porovnaním tenzorov, vrstiev a finálnych metrík. Malá priemerná chyba váh nemusí znamenať malý dopad na výstup.
Prečo sa model nemusí zrýchliť?
Niektoré operácie nemajú nízkobitový kernel, prechádzajú späť do float formátu alebo výkon obmedzuje presun dát a nie aritmetika.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Jacob et al., Quantization and Training of Neural Networks, 2018
- TensorFlow Model Optimization, Quantization
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
