Efektívne nasadenie modelov

Quantized inference

Inferencia v nízkej bitovej presnosti

Quantized inference je vykonávanie dopredného výpočtu modelu s nízkobitovými reprezentáciami a kernelmi, napríklad int8, int4 alebo zmiešanou presnosťou. Runtime načíta kvantizačné parametre, prevedie vstupy do požadovaného rozsahu, vykoná podporované operácie a podľa potreby dekvantizuje výstup. Skutočný výkon závisí od hardvéru, dátového layoutu, veľkosti dávky a počtu operácií, ktoré zostávajú vo float formáte. Kvantizovaný súbor bez kompatibilného runtime nie je dôkaz nízkobitovej exekúcie.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-Q-09

Odborná definícia

Odborná definícia

Quantized inference je vykonávanie dopredného výpočtu modelu s nízkobitovými reprezentáciami a kernelmi, napríklad int8, int4 alebo zmiešanou presnosťou. Runtime načíta kvantizačné parametre, prevedie vstupy do požadovaného rozsahu, vykoná podporované operácie a podľa potreby dekvantizuje výstup. Skutočný výkon závisí od hardvéru, dátového layoutu, veľkosti dávky a počtu operácií, ktoré zostávajú vo float formáte. Kvantizovaný súbor bez kompatibilného runtime nie je dôkaz nízkobitovej exekúcie.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Dva modely môžu mať rovnakú veľkosť na disku a odlišnú rýchlosť. Jeden beží celý v int8 kerneloch, druhý pri každej nepodporovanej vrstve prevádza údaje späť do float formátu. Prevod spotrebuje čas a energiu. Preto sa nekontroluje iba prípona súboru. Profilovanie musí ukázať, ktoré operácie sa na cieľovom zariadení vykonali v nízkej presnosti a kde vznikli prechody.

Časté otázky

Časté otázky

Je každý kvantizovaný model vhodný na integer inference?

Nie. Formát môže obsahovať kvantizované váhy, ale aktivácie alebo niektoré operácie môžu zostať vo float presnosti.

Čo je mixed-precision inference?

Rôzne vrstvy alebo tenzory používajú rozdielnu bitovú šírku podľa citlivosti a podpory hardvéru.

Ako sa meria reálne zrýchlenie?

Na cieľovom zariadení, pri typickej dávke, vrátane predspracovania, presunov pamäte a postprocessingu.

Prečo môže klesnúť presnosť iba v jednom segmente?

Niektoré vstupy aktivujú úzke rozsahy alebo citlivé cesty siete. Agregovaná metrika môže lokálnu degradáciu skryť.

Čo treba verziovať?

Kvantizovaný graf, škály, nulové body, kalibračné dáta, runtime, hardvér, kompilátor a nastavenie kernelov.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • TensorFlow Lite, Post-training quantization
  • PyTorch torchao, Quantization workflows

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.