Odborná definice
Odborná definice
Upper Confidence Bound, zkráceně UCB, je princip sekvenčného rozhodování, který pro každou akci kombinuje odhad očekávané odměny s bonusom za nejistotu. Algoritmus vybírá akci s nejvyšší hornou hranicou, čím přirozeně vyvažuje exploitation známých možností a exploration málo preskúmaných možností. Bonus klesá s počtem pozorování dané akce a roste s časem nebo štatistickou nejistotou. Teoretické regret záruky platí jen při konkrétních predpokladoch o odměnách a stacionarite. Implementace se dokumentuje presným tvarem bonusu, inicializací ramien, horizontom a pravidlem při rovnosti indexů.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si peť reklamných variant. Jeden má dobrý průměr z tisíc zobrazení, druhý o trochu slabší průměr, ale pouze z desiatich. UCB přidá méně otestovanému variantu bonus, protože jeho skutečný potenciál je ještě neistý. Pokud se ukáže slabý, bonus postupně klesne. Pokud je silný, systém ho začne využívat. Metoda tak neskúša náhodně navždy ani se příliš skoro nezamkne na první víťazný variant. Při sezónnych zmenách však staré priemery mohou zavádzat. Online experiment má chránit uživatelů obmedzeniami, protože exploration vedome zkouší i možnosti s méně známym výsledkem.
Časté otázky
Časté otázky
Co představuje exploration bonus v UCB?
Je to funkce nejistoty odhadu odměny, často závislá od logaritmu času a počtu výberů akce. Méně skúšaná akce dostane větší bonus.
Jak se UCB liší od epsilon-greedy?
Epsilon-greedy zkoumá náhodnou akci s pevnou pravděpodobností. UCB cílí exploration na možnosti, při kterých je vysoká nejistota a zároveň realistický potenciál.
Co je regret při bandit algoritmoch?
Kumulovaný rozdíl mezi odměnou optimálnej akce a odměnou skutečně zvolených akcií. UCB se navrhuje tak, aby regret rástol sublineárne.
Funguje UCB při meniacom se prostředí?
Klasická verze předpokládá stacionárne odměny. Při drifte se používají klzavé okna, discounting, change detection nebo jiné non-stationary bandit metody.
Kde se UCB používá v aplikační AI?
Při odporúčaniach, online experimentoch, výběru obsahu, alokaci rozpočtu a stromovom vyhledávání, pokud se výsledky pozorují postupně a exploration je prípustná.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Finite-time Analysis of the Multiarmed Bandit Problem Bandit Algorithms, Lattimore and Szepesvári
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
