Odborná definícia
Význam a odborné vymedzenie pojmu
AI pipeline je usporiadaný sled krokov, ktorými prechádzajú dáta, model a výsledky od získania vstupov cez čistenie, transformácie, tréning, hodnotenie, registráciu a nasadenie až po monitoring. V generatívnej aplikácii môže zahŕňať aj chunking, embedding, indexovanie, retrieval, zostavenie promptu a postprocessing. Pipeline má definovať rozhrania, verzie artefaktov, závislosti a kontrolné body, aby bol proces reprodukovateľný a zmeny sledovateľné.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Model nevzniká jedným kliknutím. Najprv sa načítajú dáta, odstránia chyby, vytvoria príznaky, model sa natrénuje, otestuje a až potom nasadí. Každý krok môže zmeniť výsledok. Ak sa v produkcii použije iný spôsob čistenia než pri tréningu, model dostáva iné vstupy a môže zlyhať. Pipeline preto funguje ako výrobná linka s označenými verziami a kontrolami. Umožňuje zopakovať proces a nájsť miesto, kde sa chyba dostala do systému. Pri každej zmene sa preto má dať určiť, ktorý krok vytvoril nový artefakt a aké testy musel tento artefakt splniť.
Časté otázky
Otázky, ktoré spresňujú význam
Aké fázy obsahuje typická tréningová pipeline?
Zahŕňa získanie a validáciu dát, rozdelenie na tréningovú, validačnú a testovaciu časť, transformácie, tréning, ladenie, výpočet metrík, bezpečnostné testy, registráciu modelu a nasadenie. Po nasadení nasleduje monitoring a zber spätnej väzby. Presné fázy závisia od úlohy, no každý výstup má mať verziu a pôvod.
Čo je training-serving skew?
Training-serving skew je rozdiel medzi spracovaním dát pri tréningu a pri produkčnej inferencii. Môže vzniknúť iným kódom, časovým oknom, chýbajúcimi hodnotami alebo dostupnosťou príznaku. Model potom v prevádzke dostáva distribúciu, na ktorú nebol pripravený. Riziko sa znižuje zdieľanými transformáciami, validačnými schémami a porovnaním štatistík medzi tréningom a produkciou.
Ako sa v pipeline zabraňuje úniku dát?
Transformácie a výber príznakov sa majú učiť iba na tréningovej časti. Testovacie dáta nesmú ovplyvniť škálovanie, výber hyperparametrov ani tvorbu promptov. Pri časových dátach sa rešpektuje chronológia a nepoužívajú sa informácie dostupné až po predikovanom okamihu. Pipeline má automatické kontroly, ktoré odhalia zakázané stĺpce a prepojenie záznamov medzi splitmi.
Prečo je dôležitá lineage artefaktov?
Lineage spája výsledný model s konkrétnou verziou dát, kódu, konfigurácie a prostredia. Pri incidente možno zistiť, ktoré vstupy a transformácie ho vytvorili a ktoré nasadenia sú dotknuté. Bez lineage sa nedá spoľahlivo reprodukovať tréning ani vykonať cielený rollback. Záznam má zahŕňať aj manuálne schválenia a výsledky kontrolných testov.
Ako sa AI pipeline automatizuje bezpečne?
Automatizácia používa CI/CD alebo MLOps nástroje, no nasadenie sa viaže na kvalitatívne brány. Model sa nepovýši iba preto, že tréning skončil. Musí splniť metriky, bezpečnostné testy, kontrolu dát a schválenie podľa rizikovej triedy. Produkčné tajomstvá sa oddelia od tréningového prostredia a každá zmena je auditovateľná a vratná.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- OECD Framework for the Classification of AI Systems
- NIST AI Risk Management Framework
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
