Výpočetní infrastruktura

Distribuovaný trénink

Distribuovaný trénink je učení modelu pomocí více výpočetních zařízení nebo uzlů, které si rozdělují data, parametry nebo části výpočtového grafu. Při data parallelism má každé zařízení kopii modelu a zpracovává jinou dávku, potom se gradienty synchronizují. Při model parallelism se samotný model rozdělí mezi zařízení. Distribuce umožňuje větší modely a kratší čas tréninku, ale přináší komunikačné náklady, problémy synchronizace, tolerance porúch, reprodukovatelnosti a efektívneho využitia hardwaru.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-20

Odborná definice

Odborná definice

Distribuovaný trénink je učení modelu pomocí více výpočetních zařízení nebo uzlů, které si rozdělují data, parametry nebo části výpočtového grafu. Při data parallelism má každé zařízení kopii modelu a zpracovává jinou dávku, potom se gradienty synchronizují. Při model parallelism se samotný model rozdělí mezi zařízení. Distribuce umožňuje větší modely a kratší čas tréninku, ale přináší komunikačné náklady, problémy synchronizace, tolerance porúch, reprodukovatelnosti a efektívneho využitia hardwaru.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Jeden akcelerátor nemusí mít dosť paměti pro model nebo by trénink trval mesiace. Distribuovaný trénink zapojí více zařízení, ale nejde pouze o jednoduché sčítání výkonu. Zařízení musí v správném okamihu zdielat gradienty nebo aktivace a najpomalší uzel může brzdit celý krok. Při velkém clustri může komunikace spotrebovat více času než samotný výpočet. Proto se volí strategie rozdělení, velikost dávky, přesnost čísel, topológia sítě a způsob obnovy po výpadku.

Časté otázky

Časté otázky

Co je data parallelism?

Každý worker zpracuje jinou část dávky na vlastnej kópii modelu. Gradienty se agregují a všechny kopie následně dostanou stejnou aktualizaci.

Co je model parallelism?

Parametry nebo vrstvy jednoho modelu jsou rozdělené mezi zařízení, protože se nezmestia do paměti jednoho akcelerátora nebo se výpočet dělí pipeline způsobem.

Proč škálování není lineární?

Roste komunikace, synchronizace, nevyužité čakání a nároky na vstupnou pipeline. Dvojnásobok zařízení proto zriedka znamená přesně polovičný čas.

Jako velká globální dávka ovlivní učení?

Může změnit šum gradientu a generalizaci. Často vyžaduje úpravu learning rate, warmup, optimalizátora nebo počtu tréninkových kroků.

Co je checkpointing v distribuovanom tréninku?

Pravidelné uložení parametrů, stavů optimalizátora a metadát, aby se trénink po výpadku obnovil bez ztráty celé vykonanej práce.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.