Výpočtová infraštruktúra

Distribuovaný tréning

Distributed training

Distribuovaný tréning je učenie modelu pomocou viacerých výpočtových zariadení alebo uzlov, ktoré si rozdeľujú dáta, parametre alebo časti výpočtového grafu. Pri data parallelism má každé zariadenie kópiu modelu a spracúva inú dávku, potom sa gradienty synchronizujú. Pri model parallelism sa samotný model rozdelí medzi zariadenia. Distribúcia umožňuje väčšie modely a kratší čas tréningu, no prináša komunikačné náklady, problémy synchronizácie, tolerancie porúch, reprodukovateľnosti a efektívneho využitia hardvéru.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-20

Odborná definícia

Odborná definícia

Distribuovaný tréning je učenie modelu pomocou viacerých výpočtových zariadení alebo uzlov, ktoré si rozdeľujú dáta, parametre alebo časti výpočtového grafu. Pri data parallelism má každé zariadenie kópiu modelu a spracúva inú dávku, potom sa gradienty synchronizujú. Pri model parallelism sa samotný model rozdelí medzi zariadenia. Distribúcia umožňuje väčšie modely a kratší čas tréningu, no prináša komunikačné náklady, problémy synchronizácie, tolerancie porúch, reprodukovateľnosti a efektívneho využitia hardvéru.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Jeden akcelerátor nemusí mať dosť pamäte pre model alebo by tréning trval mesiace. Distribuovaný tréning zapojí viac zariadení, no nejde iba o jednoduché sčítanie výkonu. Zariadenia musia v správnom okamihu zdieľať gradienty alebo aktivácie a najpomalší uzol môže brzdiť celý krok. Pri veľkom clustri môže komunikácia spotrebovať viac času než samotný výpočet. Preto sa volí stratégia rozdelenia, veľkosť dávky, presnosť čísel, topológia siete a spôsob obnovy po výpadku.

Časté otázky

Časté otázky

Čo je data parallelism?

Každý worker spracuje inú časť dávky na vlastnej kópii modelu. Gradienty sa agregujú a všetky kópie následne dostanú rovnakú aktualizáciu.

Čo je model parallelism?

Parametre alebo vrstvy jedného modelu sú rozdelené medzi zariadenia, pretože sa nezmestia do pamäte jedného akcelerátora alebo sa výpočet delí pipeline spôsobom.

Prečo škálovanie nie je lineárne?

Rastie komunikácia, synchronizácia, nevyužité čakanie a nároky na vstupnú pipeline. Dvojnásobok zariadení preto zriedka znamená presne polovičný čas.

Ako veľká globálna dávka ovplyvní učenie?

Môže zmeniť šum gradientu a generalizáciu. Často vyžaduje úpravu learning rate, warmup, optimalizátora alebo počtu tréningových krokov.

Čo je checkpointing v distribuovanom tréningu?

Pravidelné uloženie parametrov, stavov optimalizátora a metadát, aby sa tréning po výpadku obnovil bez straty celej vykonanej práce.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.