Modely a architektúry · Kompresia a riedkosť neurónových sietí

Prerezávanie modelu

Pruning

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-P-25

Odborná definícia

Význam a odborné vymedzenie pojmu

Pruning odstraňuje alebo maskuje parametre, neuróny, kanály, attention hlavy či iné štruktúry modelu, ktoré sa podľa zvoleného kritéria považujú za menej dôležité. Unstructured pruning vytvára jednotlivé nulové váhy, structured pruning odstraňuje celé bloky kompatibilné s hustými výpočtami. Metóda môže prebehnúť jednorazovo, iteratívne alebo počas tréningu a často po nej nasleduje fine-tuning. Cieľom je menší model, nižšia latencia alebo energetická úspora, no teoretická riedkosť sa zrýchlením prejaví iba vtedy, keď ju podporuje formát, kernel a cieľový hardvér.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Sieť má milióny váh, ale časť z nich prispieva k výstupu len málo. Pruning nastaví vybrané váhy na nulu alebo odstráni celé filtre a potom model doučí, aby obnovil kvalitu. Ak vznikne náhodne roztrúsená riedkosť, bežný procesor môže stále vykonávať takmer rovnakú prácu. Odstránenie celých kanálov sa implementuje ľahšie, ale môže poškodiť reprezentáciu viac než jemné maskovanie. Preto sa nehodnotí iba percento núl, ale reálna latencia, veľkosť artefaktu, presnosť kritických tried a kompatibilita s ďalšou kvantizáciou.

Časté otázky

Otázky, ktoré spresňujú význam

Aký je rozdiel medzi structured a unstructured pruningom?

Unstructured prerezáva jednotlivé váhy a vytvára nepravidelnú riedkosť. Structured odstraňuje celé kanály, filtre alebo bloky, ktoré sa jednoduchšie premietnu do menších hustých matíc.

Ako funguje pruning podľa veľkosti váhy?

Vyberá váhy s najmenšou absolútnou hodnotou podľa predpokladu, že majú menší vplyv. Je jednoduché, no ignoruje citlivosť straty a interakcie medzi parametrami.

Prečo sa model po pruningu znovu dolaďuje?

Odstránenie spojení mení výpočty a zvyšné parametre sa musia prispôsobiť. Iteratívne prerezávanie s krátkym fine-tuningom často zachová kvalitu lepšie než jednorazový veľký zásah.

Zrýchli 50 percent nulových váh inference dvojnásobne?

Nie automaticky. Nepravidelná riedkosť potrebuje sparse kernel, prináša indexovú réžiu a môže byť limitovaná pamäťou. Reálne zrýchlenie sa meria na cieľovom zariadení.

Dá sa pruning kombinovať s kvantizáciou?

Áno, obe metódy znižujú náklady iným spôsobom. Poradie a spoločné dolaďovanie ovplyvňujú kvalitu, preto treba testovať konkrétny sparsity pattern, bitovú presnosť a runtime.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • PyTorch, Sparsity overview
  • PyTorch, Pruning methods

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.