Dáta a tréning

Dátové predspracovanie

Data preprocessing

Dátové predspracovanie je riadená premena surových vstupov na reprezentáciu vhodnú pre tréning alebo inferenciu modelu. Zahŕňa napríklad čistenie chybných záznamov, spracovanie chýbajúcich hodnôt, normalizáciu, kódovanie kategórií, tokenizáciu, výber atribútov, časové agregácie a odstránenie duplicít. Kroky musia byť definované ako reprodukovateľná pipeline a parametre učené z dát sa majú odhadovať iba na tréningovej množine, inak vzniká riziko dátového úniku a rozdielu medzi tréningom a prevádzkou.

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-D-07

Odborná definícia

Odborná definícia

Dátové predspracovanie je riadená premena surových vstupov na reprezentáciu vhodnú pre tréning alebo inferenciu modelu. Zahŕňa napríklad čistenie chybných záznamov, spracovanie chýbajúcich hodnôt, normalizáciu, kódovanie kategórií, tokenizáciu, výber atribútov, časové agregácie a odstránenie duplicít. Kroky musia byť definované ako reprodukovateľná pipeline a parametre učené z dát sa majú odhadovať iba na tréningovej množine, inak vzniká riziko dátového úniku a rozdielu medzi tréningom a prevádzkou.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Surové dáta málokedy prídu v tvare, ktorý model dokáže bezpečne použiť. Dátum môže byť raz zapísaný slovom, inokedy číslom, chýbajúca cena môže znamenať nulu alebo neznámu hodnotu a rovnaký zákazník môže byť v databáze viackrát. Predspracovanie je dielňa, v ktorej sa každý takýto prípad spracuje podľa vopred daného pravidla. Ak sa pravidlá vykonávajú inak pri tréningu a inak v produkcii, model dostáva dva odlišné jazyky a jeho výkon sa môže prudko zhoršiť.

Časté otázky

Časté otázky

Ktoré kroky predspracovania sa majú fitovať iba na tréningu?

Všetky, ktoré odhadujú parametre z dát, napríklad priemer pre normalizáciu, slovník kategórií, imputáciu, výber feature alebo redukciu dimenzie.

Je čistenie dát vždy neutrálne?

Nie. Odstránenie extrémov alebo chýbajúcich hodnôt môže neprimerane odstrániť určitú skupinu a zmeniť cieľovú populáciu modelu.

Ako sa zabezpečí rovnaké spracovanie v produkcii?

Použije sa verzovaná pipeline zdieľaná medzi tréningom a servingom, testy transformácií a kontrola schémy vstupov pred inferenciou.

Patrí tokenizácia medzi predspracovanie?

Áno. Pri textových modeloch tokenizér mení text na identifikátory tokenov a jeho verzia je súčasťou modelového artefaktu, nie voľná prevádzková voľba.

Kedy je vhodné ponechať surové dáta?

Surový nemenný zdroj sa uchováva pre audit a opakovateľnosť. Model však spravidla pracuje s odvodenou, dokumentovanou a kontrolovanou reprezentáciou.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.