Optimalizácia nasadenia

Model compression

Kompresia modelu

Model compression je súbor techník znižujúcich pamäťové, výpočtové alebo prenosové nároky modelu pri zachovaní prijateľného výkonu. Zahŕňa kvantizáciu, pruning, distiláciu znalostí, low-rank aproximácie, zdieľanie parametrov a návrh menšej architektúry. Cieľ sa môže merať veľkosťou súboru, latenciou, spotrebou energie, priepustnosťou alebo nákladom. Kompresný pomer sám o sebe nestačí, pretože reálne zrýchlenie závisí od hardvéru, runtime, hustoty operácií a podpory dátového formátu.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-19

Odborná definícia

Odborná definícia

Model compression je súbor techník znižujúcich pamäťové, výpočtové alebo prenosové nároky modelu pri zachovaní prijateľného výkonu. Zahŕňa kvantizáciu, pruning, distiláciu znalostí, low-rank aproximácie, zdieľanie parametrov a návrh menšej architektúry. Cieľ sa môže merať veľkosťou súboru, latenciou, spotrebou energie, priepustnosťou alebo nákladom. Kompresný pomer sám o sebe nestačí, pretože reálne zrýchlenie závisí od hardvéru, runtime, hustoty operácií a podpory dátového formátu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Veľký model môže mať dobrú presnosť, ale nezmestí sa do mobilu alebo odpovedá príliš pomaly. Kompresia sa snaží odstrániť nadbytočné parametre, použiť menšiu číselnú presnosť alebo preniesť správanie do menšieho modelu. Výsledok treba merať na cieľovom zariadení, pretože súbor polovičnej veľkosti nemusí byť dvakrát rýchlejší. Niektoré metódy zmenia chyby nerovnomerne, napríklad zhoršia vzácne triedy alebo citlivosť na malé vstupy, hoci priemerná metrika zostane podobná.

Časté otázky

Časté otázky

Aký je rozdiel medzi pruningom a kvantizáciou?

Pruning odstraňuje alebo vynuluje parametre a štruktúry. Kvantizácia reprezentuje váhy a aktivácie menším počtom bitov.

Je menší súbor automaticky rýchlejší?

Nie. Rýchlosť závisí od podporovaných operácií, pamäťových presunov, batch size a akcelerátora. Neštruktúrovaná riedkosť nemusí priniesť zrýchlenie.

Čo je post-training quantization?

Model sa kvantizuje po tréningu, často s malou kalibračnou sadou. Je jednoduchšia, ale pri citlivých modeloch môže stratiť viac presnosti než quantization-aware training.

Ako sa hodnotí komprimovaný model?

Rovnakými úlohami a segmentmi ako pôvodný model, plus latencia, pamäť, energia, stabilita a kompatibilita na skutočnom cieľovom hardvéri.

Môže kompresia zlepšiť generalizáciu?

Mierna regularizácia alebo odstránenie nadbytočnosti môže niekedy pomôcť, ale nie je to zaručené. Primárnym cieľom je efektívnosť pri kontrolovanom poklese kvality.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Han et al., Deep Compression

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.