Odborná definice
Odborná definice
AI pipeline je usporiadaný sled kroků, kterými procházejí data, model a výsledky od získání vstupů přes čištění, transformace, trénink, hodnocení, registraci a nasazení až po monitoring. V generativní aplikaci může zahrnovat i chunking, embedding, indexování, retrieval, sestavení promptu a postprocessing. Pipeline má definovat rozhraní, verze artefaktů, závislosti a kontrolní body, aby byl proces reprodukovatelný a změny sledovatelné.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Model nevzniká jedním kliknutím. Nejprve se načítají data, odstraní chyby, vytvoří příznaky, model se natrénuje, otestuje a až potom nasadí. Každý krok může změnit výsledek. Pokud se v produkci použije jiný způsob čištění než při tréninku, model dostává jiné vstupy a může selhat. Pipeline proto funguje jako výrobná linka s označenými verzemi a kontrolami. Umožňuje zopakovat proces a najít místo, kde se chyba dostala do systému. Při každé změně se proto má dať určit, který krok vytvořil nový artefakt a jaké testy musel tento artefakt splnit.
Časté otázky
Časté otázky
Jaké fáze obsahuje typická tréninková pipeline?
Zahrnuje získání a validaci dat, rozdělení na tréninkovou, validační a testovaci část, transformace, trénink, ladění, výpočet metrik, bezpečnostní testy, registraci modelu a nasazení. Po nasazení nasleduje monitoring a sběr zpětné vazby. Přesné fáze závisí na úlohy, ale každý výstup má mít verzi a původ.
Co je training-serving skew?
Training-serving skew je rozdíl mezi spracováním dat při tréninku a při produkční inferenci. Může vzniknout jiným kódom, časovým oknom, chýbajúcimi hodnotami nebo dostupností príznaku. Model potom v provozu dostává distribuci, na kterou nebol pripravený. Riziko se snižuje zdielanými transformacemi, validačnými schémami a porovnáním statistik mezi tréninkem a produkcí.
Jak se v pipeline zabraňuje úniku dat?
Transformace a výběr příznaků se mají učit pouze na tréninkové části. Testovací data nesmějí ovlivnit škálování, výběr hyperparametrů ani tvorbu promptů. Při časových datech se respektuje chronológia a nepoužívají se informace dostupné až po predikovanom okamihu. Pipeline má automatické kontroly, které odhalia zakázané sloupce a propojení záznamů mezi splitmi.
Proč je důležitá lineage artefaktů?
Lineage spojuje výsledný model s konkrétnou verzí dat, kódu, konfigurace a prostředí. Při incidente lze zjistit, které vstupy a transformace ho vytvořili a které nasazení jsou dotknuté. Bez lineage se nedá spolehlivě reprodukovat trénink ani provést cielený rollback. Záznam má zahrnovat i manuálne schválení a výsledky kontrolných testů.
Jak se AI pipeline automatizuje bezpečně?
Automatizace používá CI/CD nebo Mlops nástroje, ale nasazení se váže na kvalitatívne brány. Model se nepovýši pouze proto, že trénink skončil. Musí splnit metriky, bezpečnostní testy, kontrolu dat a schválení podle rizikovej třídy. Produkční tajemství se oddelia od tréninkového prostředí a každá změna je auditovatelná a vratná.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- OECD Framework for the Classification of AI Systems
- NIST AI Risk Management Framework
- Google Machine Learning Glossary
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
