Odborná definice
Odborná definice
Uncertainty sampling je strategie active learningu, která na označení vybírá neoznačené příklady, při kterých si aktuální model nejméně verí. Nejistota se může měřit najnižšou maximálnou pravděpodobností, malým rozdílem mezi dvěma najlepšími třídami, entropiou nebo nesúhlasom ensemble. Cílem je získat co nejvíce informatívnych štítků za omezený rozpočet. Samotná nejistota však může uprednostnit šum, odlehlé body nebo opakované případy, proto se kombinuje s rozmanitosťou a kontrolou kvality. Anotátorovi se ukladají i důvody nejistoty a čas označení, aby se odlíšil náročný případ od chybnej taxonomie.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Pokud odborník dokáže označit pouze sto z desaťtisíc dokumentů, náhodný výběr může minúť rozpočet na lahké a podobné případy. Uncertainty sampling pošle člověku texty, při kterých model váha mezi třídami nebo dává rozptýlené pravděpodobnosti. Tak se rozhodovace hranice spresňuje rychleji. Rizikem jsou nezmyselné, poškodené nebo zcela nové vstupy, které vyvolají vysokou nejistotu, ale jejich označení nepomůže běžné provozu. Výběr proto potřebuje filtry a dávkovou diverzitu. Pokud se stále vybírá stejný typ sporných dat, je potřeba změnit strategii nebo samotnou definici tříd.
Časté otázky
Časté otázky
Jaké skóre se používá při binární klasifikaci?
Často vzdálenost pravděpodobnosti od 0,5. Najvyššiu prioritu dostanou příklady nejbližší rozhodovaciemu prahu, pokud jsou skóre kalibrované nebo aspoň monotónne užitečné.
Co je margin sampling?
Vybírá příklady s najmenším rozdílem mezi první a druhou najpravdepodobnejšou třídou. Je vhodný zejména pro multiclass klasifikaci.
Proč nestačí vybrat všechny najneistejšie body?
Mohou být navzájem téměř stejné nebo tvorit jednu anomálnu skupinu. Dávkový výběr proto přidává reprezentatívnost, shlukování nebo penalizaci podobnosti.
Jak se měří přínos active learningu?
Porovnává se learning curve výkonu vůči počtu nebo ceně nových štítků s náhodným a ďalšími baseline stratégiami na pevnom testovacom souboru.
Kdy uncertainty sampling selhává?
Při špatně kalibrovanom modeli, extrémnom posune domény, silnom šume štítků nebo když nejistota nekoreluje s informační hodnotou pro cílovou metriku.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Active Learning Literature Survey A Survey of Active Learning for Text Classification using Deep Neural Networks
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
