Odborná definícia
Odborná definícia
Unlabeled data sú príklady, pri ktorých nie je priradená cieľová hodnota, trieda, anotácia alebo požadovaný výstup pre konkrétnu supervised úlohu. Môžu obsahovať surový text, obraz, zvuk, udalosti či senzorové merania. Ich počet býva veľký a získanie je lacnejšie než odborné označovanie, no samotná dostupnosť nezaručuje reprezentatívnosť ani oprávnenie na použitie. Využívajú sa pri self-supervised a unsupervised učení, predtrénovaní, active learningu, pseudo-labelingu a odhade distribúcie. Dataset má evidovať, pre ktorú úlohu je príklad neoznačený, pretože ten istý záznam môže mať iné dostupné anotácie.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Firma môže mať milión zákazníckych e-mailov, ale iba päťtisíc z nich ručne zaradených podľa typu problému. Zvyšok je neoznačený pre túto úlohu, hoci obsahuje jazyk, témy a štruktúru, z ktorých sa model môže učiť. Self-supervised tréning si vytvorí pomocný cieľ priamo z textu, clustering odhalí skupiny a active learning vyberie najcennejšie správy na anotáciu. Pred použitím však treba riešiť súhlas, osobné údaje, duplicity, spam a rozdiel medzi historickou a budúcou prevádzkou. Neoznačený korpus sa nesmie považovať za neutrálny, keď jeho výber už odráža platformu, jazyk, čas a správanie používateľov.
Časté otázky
Časté otázky
Sú unlabeled data úplne bez informácie o výsledku?
Nemajú cieľový štítok pre danú úlohu. Môžu však obsahovať metadáta, poradie, párovanie modalít alebo kontext, ktorý vytvorí pomocný tréningový signál.
Ako sa neoznačené dáta používajú pri semi-supervised learningu?
Model sa učí z malej označenej množiny a veľkej neoznačenej množiny pomocou pseudo-labelov, consistency regularization alebo grafových vzťahov.
Môžu byť unlabeled data použité bez právnej kontroly?
Nie. Absencia štítkov neznamená absenciu osobných údajov, autorských práv, obchodného tajomstva alebo obmedzení pôvodu a účelu spracovania.
Ako sa hodnotí kvalita neoznačeného korpusu?
Kontroluje sa pôvod, pokrytie, čas, jazyky, duplicita, kontaminácia, toxický obsah, technické poškodenie a podobnosť s cieľovou produkčnou distribúciou.
Kedy sa oplatí dáta radšej označiť?
Keď cieľová chyba má vysoký dopad, pomocné ciele nereprezentujú úlohu alebo model potrebuje jasné hranice tried. Active learning môže znížiť potrebný počet štítkov.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Google Machine Learning Glossary, unlabeled example
- scikit-learn, Semi-supervised learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
