Nasadenie a MLOps · MLOps a distribuovaná infraštruktúra

Plánovanie výpočtových úloh

Job scheduling

Posledná odborná revízia
30. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-J-16

Odborná definícia

Význam a odborné vymedzenie pojmu

Job scheduling je prideľovanie tréningových, inferenčných alebo dátových úloh k dostupným výpočtovým zdrojom v čase. Plánovač zohľadňuje požiadavky na CPU, GPU, TPU, pamäť, lokalitu dát, prioritu, závislosti, kvóty, toleranciu porúch a prípadné preemption pravidlá. V ML clustri musí riešiť aj gang scheduling distribuovaných workerov, fragmentáciu akcelerátorov a dlhé experimenty. Kvalita sa meria využitím zdrojov, časom čakania, dokončením termínov, férovosťou a počtom zlyhaní. Nesprávne požiadavky môžu blokovať kapacitu alebo spôsobiť opakované OOM pády.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Tím má osem GPU a desiatky tréningov. Každý experiment potrebuje iný počet kariet, pamäte a času. Plánovač rozhoduje, ktorá úloha sa spustí teraz, ktorá počká a či možno nízkoprioritný beh prerušiť, keď príde urgentná produkčná požiadavka. Ak spustí tri dvojkartové úlohy, zostanú dve karty, na ktorých sa štvor-kartový tréning nezmestí, hoci celková kapacita nie je plne využitá. Preto musí riešiť aj fragmentáciu, skupinové pridelenie workerov, checkpointy a presun úloh po zlyhaní uzla.

Časté otázky

Otázky, ktoré spresňujú význam

Čo je gang scheduling?

Distribuovaná úloha sa spustí iba vtedy, keď sú naraz dostupné všetky požadované workery alebo zariadenia. Bez toho by časť procesu držala zdroje a čakala na zvyšok, čo môže viesť k deadlocku alebo nízkemu využitiu.

Ako funguje priorita a preemption?

Vyššie prioritná úloha môže dostať zdroje pred nižšou alebo ju prerušiť. Bez checkpointu sa však stratí výpočet. Politika musí zohľadniť náklady reštartu, SLA, férovosť tímov a maximálny čas blokovania.

Prečo sa deklarujú resource requests a limits?

Request pomáha plánovaču nájsť uzol s dostatočnou kapacitou, limit chráni cluster pred nekontrolovanou spotrebou. Podhodnotenie spôsobuje OOM alebo throttling, nadhodnotenie znižuje využitie a predlžuje frontu.

Čo je data locality?

Úloha je výhodnejšie umiestnená blízko dát, cache alebo vysokorýchlostného úložiska. Prenos veľkého datasetu cez sieť môže trvať dlhšie než samotný výpočet a vytvoriť úzke miesto pre ostatné joby.

Ako sa plánovanie monitoruje?

Sleduje sa queue time, runtime, dôvod pending stavu, využitie akcelerátorov, preemption, OOM, úspešnosť retry a náklady. Dáta sa rozdeľujú podľa tímu a typu workloadu, aby priemer nezakryl hladovanie konkrétnej fronty.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Kubernetes, Scheduling Framework Ray, Scheduling

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.