Odborná definice
Odborná definice
Job scheduling je přidělování tréninkových, inferenčných nebo datových úloh k dostupným výpočtovým zdrojem v čase. Plánovač zohladňuje požadavky na CPU, GPU, TPU, paměť, lokalitu dat, prioritu, závislosti, kvóty, toleranci porúch a prípadné preemption pravidla. V ML clustri musí řešit i gang scheduling distribuovaných workerů, fragmentaci akcelerátorů a dlouhé experimenty. Kvalita se měří využitím zdrojů, časem čakání, dokončením termínů, férovosťou a počtem zlyhaní. Nesprávně požadavky mohou blokovat kapacitu nebo způsobit opakované OOM pády.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Tím má osem GPU a desiatky tréningů. Každý experiment potřebuje jiný počet kariet, paměti a času. Plánovač rozhoduje, která úloha se spustí teraz, která počká a zda lze nízkoprioritný běh prerušit, když príde urgentná produkční požadavek. Pokud spustí tri dvojkartové úlohy, zůstanou dvě karty, na kterých se štvor-kartový trénink nezmestí, ačkoli celková kapacita není plne využitá. Proto musí řešit i fragmentaci, skupinové pridelení workerů, checkpointy a přesun úloh po zlyhaní uzla.
Časté otázky
Časté otázky
Co je gang scheduling?
Distribuovaná úloha se spustí pouze tehdy, když jsou najednou dostupné všechny požadované workery nebo zařízení. Bez toho by část procesu držala zdroje a čakala na zbytek, co může vést k deadlocku nebo nízkemu využitiu.
Jako funguje priorita a preemption?
Vyšší prioritná úloha může dostat zdroje před nižší nebo ji prerušit. Bez checkpointu se však ztratí výpočet. Politika musí zohladnit náklady reštartu, SLA, férovost tímů a maximálny čas blokování.
Proč se deklarují resource requests a limits?
Request pomáhá plánovaču najít uzel s dostatočnou kapacitou, limit chrání cluster před nekontrolovanou spotřebou. Podhodnotení způsobuje OOM nebo throttling, nadhodnotení snižuje využití a predlžuje fronty.
Co je data locality?
Úloha je výhodnejšie umiestnená blízko dat, cache nebo vysokorýchlostného úložiště. Přenos velkého datasetu přes síť může trvat déle než samotný výpočet a vytvořit úzké místo pro ostatní joby.
Jak se plánování monitoruje?
Sleduje se queue time, runtime, důvod pending stavu, využití akcelerátorů, preemption, OOM, úspěšnost retry a náklady. Data se rozdělují podle tímu a typu workloadu, aby průměr nezakryl hladování konkrétní fronty.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Kubernetes, Scheduling Framework Ray, Scheduling
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
