Odborná definice
Odborná definice
Unlabeled data jsou příklady, při kterých není priradená cílová hodnota, třída, anotace nebo požadovaný výstup pro konkrétní supervised úlohu. Mohou obsahovat surový text, obraz, zvuk, události či senzorové měření. Jejich počet bývá velký a získání je lacnejšie než odborné označování, ale samotná dostupnost nezaručuje reprezentatívnost ani oprávnění na použití. Využívají se při self-supervised a unsupervised učení, předtrénování, active learningu, pseudo-labelingu a odhade distribuce. Dataset má evidovat, pro kterou úlohu je příklad neoznačený, protože ten jistý záznam může mít jiné dostupné anotace.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Firma může mít milión zákazníckych e-mailů, ale pouze peťtisíc z nich ručně zaradených podle typu problému. Zbytek je neoznačený pro tuto úlohu, ačkoli obsahuje jazyk, témy a strukturu, z kterých se model může učit. Self-supervised trénink si vytvoří pomocný cíl přímo z textu, clustering odhalí skupiny a active learning vybere najcennejšie správy na anotaci. Před použitím však je třeba řešit souhlas, osobní údaje, duplicity, spam a rozdíl mezi historickou a budúcou prevádzkou. Neoznačený korpus se nesmí považovat za neutrálny, když jeho výběr už odráží platformu, jazyk, čas a chování uživatelů.
Časté otázky
Časté otázky
Jsou unlabeled data zcela bez informace o výsledku?
Nemají cílový štítek pro danou úlohu. Mohou však obsahovat metadata, pořadí, párování modalit nebo kontext, který vytvoří pomocný tréninkový signál.
Jak se neoznačené data používají při semi-supervised learningu?
Model se učí z malé označenej množiny a velké neoznačenej množiny pomocí pseudo-labelů, consistency regularization nebo grafových vztahů.
Mohou být unlabeled data použité bez právnej kontroly?
Ne. Absence štítků neznamená absenci osobních údajů, autorských práv, obchodného tajomstva nebo omezení původu a účelu zpracování.
Jak se hodnotí kvalita neoznačeného korpusu?
Kontroluje se původ, pokrytí, čas, jazyky, duplicita, kontaminace, toxický obsah, technické poškodení a podobnost s cílovou produkčnou distribúcí.
Kdy se vyplatí data raději označit?
Když cílová chyba má vysoký dopad, pomocné cíle nereprezentují úlohu nebo model potřebuje jasné hranice tříd. Active learning může snížit potřebný počet štítků.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Machine Learning Glossary, unlabeled example
- scikit-learn, Semi-supervised learning
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
