Odborná definice
Odborná definice
Bandit algorithm řeší sekvenční rozhodování, při kterém systém opakovaně vybírá jednu z dostupných akcií a pozoruje pouze odměnu za zvolenou akci. Cílem je maximalizovat kumulatívnu odměnu při súčasnom vyvažování prieskumu neznámých možností a využívání možností, které se dosud javili jako nejlépe. Kvalita se často vyjadřuje regretom, tedy rozdílem mezi získanou odměnou a odměnou ideálnej strategie. Kontextové bandity navíc zohladňují vlastnosti uživatele nebo situace před výběrem akce.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si web, který vybírá z piatich titulků článku. Pokud stále zobrazuje dosud najúspešnejší titulok, může přehlédnout lepší. Pokud neustále zkouší všechny možnosti, zbytočne prichádza o kliknutí. Banditový algoritmus průběžně rozhoduje, kolik návštevnosti venovat overenému variantu a kolik experimentom. Každé nové pozorování aktualizuje odhad odměny. Na rozdíl od klasického A/B testu může alokaci měnit během experimentu, co však komplikuje inferenci a vyžaduje vhodné pravidla hodnocení.
Časté otázky
Časté otázky
Co je exploration a exploitation?
Exploration znamená skúšat méně preskúmané akce, aby systém získal informace. Exploitation znamená volit akci s nejvyšší odhadovanou odměnou. Dobrá politika minimalizuje dlhodobou ztrátu spůsobenou prílišnou opatrností i prílišným experimentováním.
Co měří regret?
Regret porovnává odměnu algoritmu s referenčnou stratégiou, která by poznala najlepšiu akci nebo optimální politiku. Nízký regret znamená, že cena učení a nesprávnych volieb zostala malá ve srovnání s ideálom.
Kdy je vhodný kontextový bandit?
Když se nejlepší akce mění podle kontextu, například segmentu, zařízení, času nebo obsahu. Model odhaduje odměnu akce podmienenou vlastnostmi situace, takže nemusí hladat jednu univerzálnu volbu pro všech.
Je bandit vhodný pro medicínské rozhodování?
Může být výskumným nástrojem, ale vysoké riziko vyžaduje etické a regulačné omezení, bezpečné akce, informovaný souhlas a nezávislý dohled. Optimalizace odměny nesmí vystavit pacienta neprijatelnému experimentálnemu riziku.
Jak se řeší změna chování uživatelů v čase?
Při nestacionárnom prostředí se používají klzavé okna, diskontování starých pozorování, detekce změn nebo modely s časovo premenlivými parametry. Algoritmus musí zabudnúť část minulosti, jinak může zotrvat při variantě, který už nefunguje.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Auer, Cesa-Bianchi a Fischer, Finite-time Analysis of the Multiarmed Bandit Problem
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
