Odborná definícia
Význam a odborné vymedzenie pojmu
Job scheduling je prideľovanie tréningových, inferenčných alebo dátových úloh k dostupným výpočtovým zdrojom v čase. Plánovač zohľadňuje požiadavky na CPU, GPU, TPU, pamäť, lokalitu dát, prioritu, závislosti, kvóty, toleranciu porúch a prípadné preemption pravidlá. V ML clustri musí riešiť aj gang scheduling distribuovaných workerov, fragmentáciu akcelerátorov a dlhé experimenty. Kvalita sa meria využitím zdrojov, časom čakania, dokončením termínov, férovosťou a počtom zlyhaní. Nesprávne požiadavky môžu blokovať kapacitu alebo spôsobiť opakované OOM pády.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Tím má osem GPU a desiatky tréningov. Každý experiment potrebuje iný počet kariet, pamäte a času. Plánovač rozhoduje, ktorá úloha sa spustí teraz, ktorá počká a či možno nízkoprioritný beh prerušiť, keď príde urgentná produkčná požiadavka. Ak spustí tri dvojkartové úlohy, zostanú dve karty, na ktorých sa štvor-kartový tréning nezmestí, hoci celková kapacita nie je plne využitá. Preto musí riešiť aj fragmentáciu, skupinové pridelenie workerov, checkpointy a presun úloh po zlyhaní uzla.
Časté otázky
Otázky, ktoré spresňujú význam
Čo je gang scheduling?
Distribuovaná úloha sa spustí iba vtedy, keď sú naraz dostupné všetky požadované workery alebo zariadenia. Bez toho by časť procesu držala zdroje a čakala na zvyšok, čo môže viesť k deadlocku alebo nízkemu využitiu.
Ako funguje priorita a preemption?
Vyššie prioritná úloha môže dostať zdroje pred nižšou alebo ju prerušiť. Bez checkpointu sa však stratí výpočet. Politika musí zohľadniť náklady reštartu, SLA, férovosť tímov a maximálny čas blokovania.
Prečo sa deklarujú resource requests a limits?
Request pomáha plánovaču nájsť uzol s dostatočnou kapacitou, limit chráni cluster pred nekontrolovanou spotrebou. Podhodnotenie spôsobuje OOM alebo throttling, nadhodnotenie znižuje využitie a predlžuje frontu.
Čo je data locality?
Úloha je výhodnejšie umiestnená blízko dát, cache alebo vysokorýchlostného úložiska. Prenos veľkého datasetu cez sieť môže trvať dlhšie než samotný výpočet a vytvoriť úzke miesto pre ostatné joby.
Ako sa plánovanie monitoruje?
Sleduje sa queue time, runtime, dôvod pending stavu, využitie akcelerátorov, preemption, OOM, úspešnosť retry a náklady. Dáta sa rozdeľujú podľa tímu a typu workloadu, aby priemer nezakryl hladovanie konkrétnej fronty.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Kubernetes, Scheduling Framework Ray, Scheduling
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
