Nasadenie a MLOps · Výpočtová infraštruktúra

Distributed training

Distribuovaný tréning

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-20

Odborná definícia

Význam a odborné vymedzenie pojmu

Distribuovaný tréning je učenie modelu pomocou viacerých výpočtových zariadení alebo uzlov, ktoré si rozdeľujú dáta, parametre alebo časti výpočtového grafu. Pri data parallelism má každé zariadenie kópiu modelu a spracúva inú dávku, potom sa gradienty synchronizujú. Pri model parallelism sa samotný model rozdelí medzi zariadenia. Distribúcia umožňuje väčšie modely a kratší čas tréningu, no prináša komunikačné náklady, problémy synchronizácie, tolerancie porúch, reprodukovateľnosti a efektívneho využitia hardvéru.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Jeden akcelerátor nemusí mať dosť pamäte pre model alebo by tréning trval mesiace. Distribuovaný tréning zapojí viac zariadení, no nejde iba o jednoduché sčítanie výkonu. Zariadenia musia v správnom okamihu zdieľať gradienty alebo aktivácie a najpomalší uzol môže brzdiť celý krok. Pri veľkom clustri môže komunikácia spotrebovať viac času než samotný výpočet. Preto sa volí stratégia rozdelenia, veľkosť dávky, presnosť čísel, topológia siete a spôsob obnovy po výpadku.

Časté otázky

Otázky, ktoré spresňujú význam

Čo je data parallelism?

Každý worker spracuje inú časť dávky na vlastnej kópii modelu. Gradienty sa agregujú a všetky kópie následne dostanú rovnakú aktualizáciu.

Čo je model parallelism?

Parametre alebo vrstvy jedného modelu sú rozdelené medzi zariadenia, pretože sa nezmestia do pamäte jedného akcelerátora alebo sa výpočet delí pipeline spôsobom.

Prečo škálovanie nie je lineárne?

Rastie komunikácia, synchronizácia, nevyužité čakanie a nároky na vstupnú pipeline. Dvojnásobok zariadení preto zriedka znamená presne polovičný čas.

Ako veľká globálna dávka ovplyvní učenie?

Môže zmeniť šum gradientu a generalizáciu. Často vyžaduje úpravu learning rate, warmup, optimalizátora alebo počtu tréningových krokov.

Čo je checkpointing v distribuovanom tréningu?

Pravidelné uloženie parametrov, stavov optimalizátora a metadát, aby sa tréning po výpadku obnovil bez straty celej vykonanej práce.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.