Odborná definícia
Odborná definícia
Training data sú príklady použité na odhad parametrov modelu alebo na prispôsobenie jeho správania. Môžu obsahovať vstupy, štítky, preferencie, páry otázka a odpoveď, simulácie alebo neoznačený obsah pre self-supervised učenie. Ich význam určuje nielen objem, ale aj pôvod, licencia, reprezentatívnosť, kvalita anotácie, časové obdobie a spôsob vzorkovania. Tréningové dáta musia zostať oddelené od validačných a testovacích dát, inak sa výkon nadhodnotí. Verzia datasetu sa viaže na konkrétny tréningový beh a obsahuje zoznam vylúčení, opráv a známych medzier.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Model sa učí z konkrétneho výrezu sveta, nie zo sveta ako takého. Ak tréningová zbierka obsahuje najmä veľké firmy, model nemusí správne fungovať pre živnostníkov. Ak sa rovnaké dokumenty objavia aj v teste, výsledok meria pamäť, nie schopnosť zovšeobecniť. Dôležité je vedieť, odkiaľ každý zdroj pochádza, na čo sa smie použiť a aké skupiny v ňom chýbajú. Pri priebežnom učení treba evidovať aj čas, pretože neskoršie dáta môžu prezradiť budúcnosť starším príkladom. Bez tejto väzby nemožno spätne vysvetliť, prečo dve verzie modelu reagujú na rovnaký prípad rozdielne.
Časté otázky
Časté otázky
Ako sa training data líšia od validation data?
Tréningové dáta upravujú parametre modelu. Validačné dáta slúžia na výber konfigurácie, prahov a skoré zastavenie bez priameho učenia parametrov.
Čo je data provenance?
Evidencia pôvodu, spôsobu získania, licencií, transformácií, vlastníka a verzie dát. Umožňuje audit, odstránenie problematického zdroja a reprodukciu modelu.
Prečo viac dát nemusí zlepšiť model?
Dodatočné dáta môžu byť nekvalitné, duplicitné, mimo cieľovej domény alebo systematicky zaujaté. Zmenia tréningové rozdelenie a môžu zhoršiť kritické skupiny.
Ako sa hľadajú duplicity medzi tréningom a testom?
Používa sa presné hashovanie, fuzzy porovnávanie, embeddingová podobnosť a doménové pravidlá. Kontrolujú sa aj odvodené verzie toho istého dokumentu alebo subjektu.
Čo je dataset shift?
Rozdiel medzi rozdelením tréningových dát a dát pri nasadení. Môže sa meniť vstup, vzťah medzi vstupom a cieľom alebo zastúpenie jednotlivých skupín.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NIST AI Risk Management Framework 1.0 Datasheets for Datasets
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
