Data a trénink

Datové předzpracování

Datové předzpracování je řízená premena surových vstupů na reprezentaci vhodnou pro trénink nebo inferenci modelu. Zahrnuje například čištění chybných záznamů, zpracování chybějících hodnot, normalizaci, kódování kategorií, tokenizaci, výběr atributů, časové agregace a odstranění duplicít. Kroky musí být definované jako reprodukovatelná pipeline a parametry učené z dat se mají odhadovat pouze na tréninkové množině, jinak vzniká riziko datového úniku a rozdílu mezi tréninkem a prevádzkou.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-07

Odborná definice

Odborná definice

Datové předzpracování je řízená premena surových vstupů na reprezentaci vhodnou pro trénink nebo inferenci modelu. Zahrnuje například čištění chybných záznamů, zpracování chybějících hodnot, normalizaci, kódování kategorií, tokenizaci, výběr atributů, časové agregace a odstranění duplicít. Kroky musí být definované jako reprodukovatelná pipeline a parametry učené z dat se mají odhadovat pouze na tréninkové množině, jinak vzniká riziko datového úniku a rozdílu mezi tréninkem a prevádzkou.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Surová data málokedy prídu v tvaru, který model dokáže bezpečně použít. Datum může být raz zapísaný slovem, inokedy číslem, chýbajúca cena může znamenat nulu nebo neznámou hodnotu a stejný zákazník může být v databázi viackrát. Předzpracování je dielňa, ve které se každý takový případ zpracuje podle předem daného pravidla. Pokud se pravidla vykonávají jinak při tréninku a jinak v produkci, model dostává dva odlišné jazyky a jeho výkon se může prudko zhoršit.

Časté otázky

Časté otázky

Které kroky předzpracování se mají fitovat pouze na tréninku?

Všechny, které odhadují parametry z dat, například průměr pro normalizaci, slovník kategorií, imputaci, výběr feature nebo redukci dimenze.

Je čištění dat vždy neutrálne?

Ne. Odstranění extrémů nebo chybějících hodnot může nepřiměřeně odstranit určitou skupinu a změnit cílovou populaci modelu.

Jak se zabezpečí stejné zpracování v produkci?

Použije se verzovaná pipeline zdielaná mezi tréninkem a servingom, testy transformací a kontrola schémata vstupů před inferencí.

Patří tokenizace mezi předzpracování?

Ano. Při textových modelech tokenizér mění text na identifikátory tokenů a jeho verze je součástí modelového artefaktu, ne volná provozní volba.

Kdy je vhodné ponechat surová data?

Surový nemenný zdroj se uchovává pro audit a opakovatelnost. Model však zpravidla pracuje s odvodenou, dokumentovanou a kontrolovanou reprezentací.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.