Revize: 1. august 2026

Kvantizace modelu

Quantization je mapování hodnot s vysokou nebo spojitou přesností na menší konečnou množinu reprezentovatelných úrovní. Při neuronových sítích se kvantizují váhy, aktivace nebo medzivýsledky, například z float32 na int8 nebo 4-bitový formát. Lineární kvantizace používá měřítko a často nulový bod; může být symetrická, asymetrická, per-tensor nebo per-channel. Snížení bitové šířky šetří paměť a prenosy, ale přidává zaokrúhlovaci a saturujúcu chybu a vyžaduje podporu cílových kernelů.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-07

Odborná definice

Odborná definice

Quantization je mapování hodnot s vysokou nebo spojitou přesností na menší konečnou množinu reprezentovatelných úrovní. Při neuronových sítích se kvantizují váhy, aktivace nebo medzivýsledky, například z float32 na int8 nebo 4-bitový formát. Lineární kvantizace používá měřítko a často nulový bod; může být symetrická, asymetrická, per-tensor nebo per-channel. Snížení bitové šířky šetří paměť a prenosy, ale přidává zaokrúhlovaci a saturujúcu chybu a vyžaduje podporu cílových kernelů.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si měření délky pravítkom, které má pouze celé milimetre. Hodnota 12,37 mm se musí uložit jako najbližší dostupný stupeň. Jemnější pravítko je přesněji, ale potřebuje více bitů. U modelu se takto zaokrúhlují milióny čísel. Pokud je rozsah zvolený špatně, velké hodnoty se orežou a malé se zlejou do stejné úrovně. Úspora v souboru proto sama neříká, zda se zrýchli reálna aplikace nebo zachová kvalita.

Časté otázky

Časté otázky

Co určuje scale a zero point?

Scale převádí vzdálenost mezi kvantizačnými úrovňami a reálnymi hodnotami. Zero point zabezpečuje reprezentaci reálné nuly při asymetrickom rozsahu.

Co znamená per-channel quantization?

Každý výstupný kanál, případně jiná os, má vlastní měřítko. Lépe zachytí rozdílně rozsahy, ale zvyšuje složitost.

Je 4-bit vždy dvakrát menší než 8-bit?

Ne v celém artefakte. Metadata, škály, nekvantizované vrstvy a formát balení mění výslednou velikost.

Jak se měří kvantizačná chyba?

Porovnáním tenzorů, vrstev a finálnych metrik. Malá průměrná chyba váh nemusí znamenat malý dopad na výstup.

Proč se model nemusí zrychlit?

Některé operace nemají nízkobitový kernel, procházejí zpět do float formátu nebo výkon omezuje přesun dat a ne aritmetika.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Jacob et al., Quantization and Training of Neural Networks, 2018
  • TensorFlow Model Optimization, Quantization

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.