Odborná definícia
Význam a odborné vymedzenie pojmu
Active learning je prístup k strojovému učeniu, pri ktorom model alebo výberová stratégia určuje, ktoré neoznačené príklady majú byť predložené človeku či inému orákulu na doplnenie správneho štítku. Cieľom je dosiahnuť požadovanú kvalitu s menším množstvom draho označených dát. Výber môže vychádzať z neistoty modelu, reprezentatívnosti vzorky, očakávanej zmeny modelu alebo kombinácie kritérií. Proces prebieha iteratívne. Výberová politika sa musí hodnotiť oddelene od modelu, pretože môže meniť zloženie novozískaných tréningových dát.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Namiesto označenia milióna snímok necháme model vybrať tie, pri ktorých si je najmenej istý alebo ktoré pokrývajú doteraz neznámu časť dát. Odborník označí iba tento užší výber, model sa pretrénuje a cyklus sa zopakuje. Tak možno sústrediť čas lekárov, právnikov či technikov na prípady s najvyššou informačnou hodnotou. Úspora však vznikne iba vtedy, keď výber nezanedbá dôležité skupiny a proces označovania je spoľahlivý. Dôležitá je aj cena jedného označenia, pretože zložité hraničné prípady môžu vyžadovať viac expertov alebo dodatočné meranie.
Časté otázky
Otázky, ktoré spresňujú význam
Čo je v active learningu orákulum?
Orákulum je zdroj správneho označenia pre vybraný príklad. Najčastejšie ide o človeka s doménovou expertízou, môže to však byť laboratórny test, presný merací proces alebo drahší referenčný systém. Kvalita orákula je kritická, pretože model cielene vyberá náročné prípady, pri ktorých môže byť nezhoda medzi hodnotiteľmi vyššia než pri bežných dátach.
Ako model vyberá príklady na označenie?
Pri uncertainty sampling vyberá prípady s najnižšou istotou alebo najmenším rozdielom medzi najpravdepodobnejšími triedami. Query-by-committee hľadá prípady, pri ktorých sa nezhodnú viaceré modely. Iné stratégie uprednostňujú reprezentatívne body v dátovom priestore alebo odhadujú, ktorý štítok najviac zníži budúcu chybu.
Kedy active learning prináša najväčšiu úsporu?
Najväčší prínos má vtedy, keď je neoznačených dát veľa, označenie je drahé a medzi príkladmi existujú výrazné rozdiely v informačnej hodnote. Typické sú medicínske snímky, právne dokumenty alebo priemyselné poruchy. Menší efekt možno čakať, ak je označovanie lacné, model už dosiahol limit kvality alebo vybrané prípady nemožno spoľahlivo rozhodnúť.
Aké riziko vzniká výberovým skreslením?
Dáta vybrané modelom nemusia reprezentovať reálnu prevádzku. Ak sa trénuje iba na neistých prípadoch, môže sa zmeniť distribúcia tréningovej sady a zhoršiť kalibrácia. Preto sa uchováva náhodná kontrolná vzorka, sledujú sa segmenty populácie a pri vyhodnotení sa používa nezávislá testovacia sada, ktorá nebola vytvorená výberovou politikou.
Ako sa active learning ukončuje?
Cyklus sa ukončí, keď ďalšie označenia prinášajú zanedbateľné zlepšenie, vyčerpá sa rozpočet alebo model dosiahne vopred stanovenú kvalitu a bezpečnostné limity. Rozhodnutie nemá vychádzať iba z priemernej metriky. Treba overiť citlivé segmenty, stabilitu medzi iteráciami a to, či model nezačal opakovane vyberať nerozhodnuteľné či chybné prípady.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Google Machine Learning Glossary
- NIST AI 600-1, Generative AI Profile
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
