Nasadenie a MLOps · Životný cyklus a infraštruktúra

AI pipeline

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-17

Odborná definícia

Význam a odborné vymedzenie pojmu

AI pipeline je usporiadaný sled krokov, ktorými prechádzajú dáta, model a výsledky od získania vstupov cez čistenie, transformácie, tréning, hodnotenie, registráciu a nasadenie až po monitoring. V generatívnej aplikácii môže zahŕňať aj chunking, embedding, indexovanie, retrieval, zostavenie promptu a postprocessing. Pipeline má definovať rozhrania, verzie artefaktov, závislosti a kontrolné body, aby bol proces reprodukovateľný a zmeny sledovateľné.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Model nevzniká jedným kliknutím. Najprv sa načítajú dáta, odstránia chyby, vytvoria príznaky, model sa natrénuje, otestuje a až potom nasadí. Každý krok môže zmeniť výsledok. Ak sa v produkcii použije iný spôsob čistenia než pri tréningu, model dostáva iné vstupy a môže zlyhať. Pipeline preto funguje ako výrobná linka s označenými verziami a kontrolami. Umožňuje zopakovať proces a nájsť miesto, kde sa chyba dostala do systému. Pri každej zmene sa preto má dať určiť, ktorý krok vytvoril nový artefakt a aké testy musel tento artefakt splniť.

Časté otázky

Otázky, ktoré spresňujú význam

Aké fázy obsahuje typická tréningová pipeline?

Zahŕňa získanie a validáciu dát, rozdelenie na tréningovú, validačnú a testovaciu časť, transformácie, tréning, ladenie, výpočet metrík, bezpečnostné testy, registráciu modelu a nasadenie. Po nasadení nasleduje monitoring a zber spätnej väzby. Presné fázy závisia od úlohy, no každý výstup má mať verziu a pôvod.

Čo je training-serving skew?

Training-serving skew je rozdiel medzi spracovaním dát pri tréningu a pri produkčnej inferencii. Môže vzniknúť iným kódom, časovým oknom, chýbajúcimi hodnotami alebo dostupnosťou príznaku. Model potom v prevádzke dostáva distribúciu, na ktorú nebol pripravený. Riziko sa znižuje zdieľanými transformáciami, validačnými schémami a porovnaním štatistík medzi tréningom a produkciou.

Ako sa v pipeline zabraňuje úniku dát?

Transformácie a výber príznakov sa majú učiť iba na tréningovej časti. Testovacie dáta nesmú ovplyvniť škálovanie, výber hyperparametrov ani tvorbu promptov. Pri časových dátach sa rešpektuje chronológia a nepoužívajú sa informácie dostupné až po predikovanom okamihu. Pipeline má automatické kontroly, ktoré odhalia zakázané stĺpce a prepojenie záznamov medzi splitmi.

Prečo je dôležitá lineage artefaktov?

Lineage spája výsledný model s konkrétnou verziou dát, kódu, konfigurácie a prostredia. Pri incidente možno zistiť, ktoré vstupy a transformácie ho vytvorili a ktoré nasadenia sú dotknuté. Bez lineage sa nedá spoľahlivo reprodukovať tréning ani vykonať cielený rollback. Záznam má zahŕňať aj manuálne schválenia a výsledky kontrolných testov.

Ako sa AI pipeline automatizuje bezpečne?

Automatizácia používa CI/CD alebo MLOps nástroje, no nasadenie sa viaže na kvalitatívne brány. Model sa nepovýši iba preto, že tréning skončil. Musí splniť metriky, bezpečnostné testy, kontrolu dát a schválenie podľa rizikovej triedy. Produkčné tajomstvá sa oddelia od tréningového prostredia a každá zmena je auditovateľná a vratná.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • OECD Framework for the Classification of AI Systems
  • NIST AI Risk Management Framework
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.