Bandity a reinforcement learning

horní hranice spolahlivosti při sekvenčním výběru

Upper Confidence Bound, zkráceně UCB, je princip sekvenčného rozhodování, který pro každou akci kombinuje odhad očekávané odměny s bonusom za nejistotu. Algoritmus vybírá akci s nejvyšší hornou hranicou, čím přirozeně vyvažuje exploitation známých možností a exploration málo preskúmaných možností. Bonus klesá s počtem pozorování dané akce a roste s časem nebo štatistickou nejistotou. Teoretické regret záruky platí jen při konkrétních predpokladoch o odměnách a stacionarite. Implementace se dokumentuje presným tvarem bonusu, inicializací ramien, horizontom a pravidlem při rovnosti indexů.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-22

Odborná definice

Odborná definice

Upper Confidence Bound, zkráceně UCB, je princip sekvenčného rozhodování, který pro každou akci kombinuje odhad očekávané odměny s bonusom za nejistotu. Algoritmus vybírá akci s nejvyšší hornou hranicou, čím přirozeně vyvažuje exploitation známých možností a exploration málo preskúmaných možností. Bonus klesá s počtem pozorování dané akce a roste s časem nebo štatistickou nejistotou. Teoretické regret záruky platí jen při konkrétních predpokladoch o odměnách a stacionarite. Implementace se dokumentuje presným tvarem bonusu, inicializací ramien, horizontom a pravidlem při rovnosti indexů.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si peť reklamných variant. Jeden má dobrý průměr z tisíc zobrazení, druhý o trochu slabší průměr, ale pouze z desiatich. UCB přidá méně otestovanému variantu bonus, protože jeho skutečný potenciál je ještě neistý. Pokud se ukáže slabý, bonus postupně klesne. Pokud je silný, systém ho začne využívat. Metoda tak neskúša náhodně navždy ani se příliš skoro nezamkne na první víťazný variant. Při sezónnych zmenách však staré priemery mohou zavádzat. Online experiment má chránit uživatelů obmedzeniami, protože exploration vedome zkouší i možnosti s méně známym výsledkem.

Časté otázky

Časté otázky

Co představuje exploration bonus v UCB?

Je to funkce nejistoty odhadu odměny, často závislá od logaritmu času a počtu výberů akce. Méně skúšaná akce dostane větší bonus.

Jak se UCB liší od epsilon-greedy?

Epsilon-greedy zkoumá náhodnou akci s pevnou pravděpodobností. UCB cílí exploration na možnosti, při kterých je vysoká nejistota a zároveň realistický potenciál.

Co je regret při bandit algoritmoch?

Kumulovaný rozdíl mezi odměnou optimálnej akce a odměnou skutečně zvolených akcií. UCB se navrhuje tak, aby regret rástol sublineárne.

Funguje UCB při meniacom se prostředí?

Klasická verze předpokládá stacionárne odměny. Při drifte se používají klzavé okna, discounting, change detection nebo jiné non-stationary bandit metody.

Kde se UCB používá v aplikační AI?

Při odporúčaniach, online experimentoch, výběru obsahu, alokaci rozpočtu a stromovom vyhledávání, pokud se výsledky pozorují postupně a exploration je prípustná.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Finite-time Analysis of the Multiarmed Bandit Problem Bandit Algorithms, Lattimore and Szepesvári

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.