Odborná definícia
Odborná definícia
Tabular data sú údaje usporiadané do riadkov a stĺpcov, kde riadok zvyčajne predstavuje pozorovanie a stĺpec konkrétnu vlastnosť. Stĺpce môžu obsahovať čísla, kategórie, dátumy, textové identifikátory alebo chýbajúce hodnoty. Pri strojovom učení je rozhodujúca sémantika stĺpcov, jednotky, čas vzniku a pravidlá výberu riadkov. Samotná obdĺžniková forma nezaručuje nezávislosť záznamov ani vhodnosť náhodného delenia dát. Pri audite sa kontroluje aj granularita riadka, aby jeden záznam nepredstavoval raz osobu a inokedy udalosť.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Tabuľka zákazníkov môže mať v každom riadku jednu osobu a v stĺpcoch vek, región, nákupy či dátum poslednej návštevy. Model však nevidí význam hlavičiek tak ako analytik. Potrebuje správne zakódovať kategórie, ošetriť chýbajúce hodnoty a rešpektovať čas. Ak sa do tréningu dostane údaj vytvorený až po sledovanej udalosti, výsledok vyzerá výborne, ale pri reálnom použití zlyhá. Najväčšie riziká preto často vznikajú ešte pred výberom algoritmu. Pred modelovaním má analytik vytvoriť dátový slovník a ukážku časovej osi každého stĺpca.
Časté otázky
Časté otázky
Sú tabuľkové dáta vždy uložené v jednom súbore?
Nie. Logická tabuľka môže vzniknúť spojením databázových tabuliek, udalostí, CRM záznamov a externých zdrojov. Pri spájaní treba kontrolovať kľúče, násobenie riadkov a časovú dostupnosť údajov.
Aký model sa hodí na tabular data?
Často fungujú gradientne posilnené stromy, lineárne modely alebo neurónové architektúry určené pre tabuľky. Voľba závisí od veľkosti dát, typov stĺpcov, nelinearít a požiadavky na vysvetlenie.
Prečo je náhodný split niekedy chybný?
Pri časových, skupinových alebo opakovaných záznamoch môže rovnaký subjekt či budúca informácia preniknúť do tréningu aj testu. Vhodnejší je časový alebo skupinový split.
Ako sa pracuje s chýbajúcimi hodnotami?
Možno ich imputovať, modelovať ako samostatnú kategóriu alebo použiť algoritmus, ktorý ich spracuje priamo. Dôležité je rozlíšiť náhodné chýbanie od systematického signálu.
Čo treba dokumentovať pri tabuľkovom datasete?
Pôvod každého stĺpca, jednotku, typ, čas dostupnosti, pravidlá čistenia, populáciu, cieľovú premennú a spôsob delenia. Bez toho sa model nedá spoľahlivo reprodukovať ani auditovať.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- scikit-learn, Column Transformer with Mixed Types TabNet: Attentive Interpretable Tabular Learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
