Trénovanie a optimalizácia · Učenie s obmedzeným označovaním

Active learning

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-05

Odborná definícia

Význam a odborné vymedzenie pojmu

Active learning je prístup k strojovému učeniu, pri ktorom model alebo výberová stratégia určuje, ktoré neoznačené príklady majú byť predložené človeku či inému orákulu na doplnenie správneho štítku. Cieľom je dosiahnuť požadovanú kvalitu s menším množstvom draho označených dát. Výber môže vychádzať z neistoty modelu, reprezentatívnosti vzorky, očakávanej zmeny modelu alebo kombinácie kritérií. Proces prebieha iteratívne. Výberová politika sa musí hodnotiť oddelene od modelu, pretože môže meniť zloženie novozískaných tréningových dát.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Namiesto označenia milióna snímok necháme model vybrať tie, pri ktorých si je najmenej istý alebo ktoré pokrývajú doteraz neznámu časť dát. Odborník označí iba tento užší výber, model sa pretrénuje a cyklus sa zopakuje. Tak možno sústrediť čas lekárov, právnikov či technikov na prípady s najvyššou informačnou hodnotou. Úspora však vznikne iba vtedy, keď výber nezanedbá dôležité skupiny a proces označovania je spoľahlivý. Dôležitá je aj cena jedného označenia, pretože zložité hraničné prípady môžu vyžadovať viac expertov alebo dodatočné meranie.

Časté otázky

Otázky, ktoré spresňujú význam

Čo je v active learningu orákulum?

Orákulum je zdroj správneho označenia pre vybraný príklad. Najčastejšie ide o človeka s doménovou expertízou, môže to však byť laboratórny test, presný merací proces alebo drahší referenčný systém. Kvalita orákula je kritická, pretože model cielene vyberá náročné prípady, pri ktorých môže byť nezhoda medzi hodnotiteľmi vyššia než pri bežných dátach.

Ako model vyberá príklady na označenie?

Pri uncertainty sampling vyberá prípady s najnižšou istotou alebo najmenším rozdielom medzi najpravdepodobnejšími triedami. Query-by-committee hľadá prípady, pri ktorých sa nezhodnú viaceré modely. Iné stratégie uprednostňujú reprezentatívne body v dátovom priestore alebo odhadujú, ktorý štítok najviac zníži budúcu chybu.

Kedy active learning prináša najväčšiu úsporu?

Najväčší prínos má vtedy, keď je neoznačených dát veľa, označenie je drahé a medzi príkladmi existujú výrazné rozdiely v informačnej hodnote. Typické sú medicínske snímky, právne dokumenty alebo priemyselné poruchy. Menší efekt možno čakať, ak je označovanie lacné, model už dosiahol limit kvality alebo vybrané prípady nemožno spoľahlivo rozhodnúť.

Aké riziko vzniká výberovým skreslením?

Dáta vybrané modelom nemusia reprezentovať reálnu prevádzku. Ak sa trénuje iba na neistých prípadoch, môže sa zmeniť distribúcia tréningovej sady a zhoršiť kalibrácia. Preto sa uchováva náhodná kontrolná vzorka, sledujú sa segmenty populácie a pri vyhodnotení sa používa nezávislá testovacia sada, ktorá nebola vytvorená výberovou politikou.

Ako sa active learning ukončuje?

Cyklus sa ukončí, keď ďalšie označenia prinášajú zanedbateľné zlepšenie, vyčerpá sa rozpočet alebo model dosiahne vopred stanovenú kvalitu a bezpečnostné limity. Rozhodnutie nemá vychádzať iba z priemernej metriky. Treba overiť citlivé segmenty, stabilitu medzi iteráciami a to, či model nezačal opakovane vyberať nerozhodnuteľné či chybné prípady.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • Google Machine Learning Glossary
  • NIST AI 600-1, Generative AI Profile

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.