Trénování a optimalizace · Bandity a reinforcement learning

Horní hranice spolahlivosti při sekvenčním výběru

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-U-22

Odborná definice

Význam a odborné vymezení pojmu

Upper Confidence Bound, zkráceně UCB, je princip sekvenčného rozhodování, který pro každou akci kombinuje odhad očekávané odměny s bonusom za nejistotu. Algoritmus vybírá akci s nejvyšší hornou hranicou, čím přirozeně vyvažuje exploitation známých možností a exploration málo preskúmaných možností. Bonus klesá s počtem pozorování dané akce a roste s časem nebo štatistickou nejistotou. Teoretické regret záruky platí jen při konkrétních predpokladoch o odměnách a stacionarite. Implementace se dokumentuje presným tvarem bonusu, inicializací ramien, horizontom a pravidlem při rovnosti indexů.

Srozumitelné vysvětlení

Jak se pojem používá v praxi

Představte si peť reklamných variant. Jeden má dobrý průměr z tisíc zobrazení, druhý o trochu slabší průměr, ale pouze z desiatich. UCB přidá méně otestovanému variantu bonus, protože jeho skutečný potenciál je ještě neistý. Pokud se ukáže slabý, bonus postupně klesne. Pokud je silný, systém ho začne využívat. Metoda tak neskúša náhodně navždy ani se příliš skoro nezamkne na první víťazný variant. Při sezónnych zmenách však staré priemery mohou zavádzat. Online experiment má chránit uživatelů obmedzeniami, protože exploration vedome zkouší i možnosti s méně známym výsledkem.

Časté otázky

Otázky, které upřesňují význam

Co představuje exploration bonus v UCB?

Je to funkce nejistoty odhadu odměny, často závislá od logaritmu času a počtu výberů akce. Méně skúšaná akce dostane větší bonus.

Jak se UCB liší od epsilon-greedy?

Epsilon-greedy zkoumá náhodnou akci s pevnou pravděpodobností. UCB cílí exploration na možnosti, při kterých je vysoká nejistota a zároveň realistický potenciál.

Co je regret při bandit algoritmoch?

Kumulovaný rozdíl mezi odměnou optimálnej akce a odměnou skutečně zvolených akcií. UCB se navrhuje tak, aby regret rástol sublineárne.

Funguje UCB při meniacom se prostředí?

Klasická verze předpokládá stacionárne odměny. Při drifte se používají klzavé okna, discounting, change detection nebo jiné non-stationary bandit metody.

Kde se UCB používá v aplikační AI?

Při odporúčaniach, online experimentoch, výběru obsahu, alokaci rozpočtu a stromovom vyhledávání, pokud se výsledky pozorují postupně a exploration je prípustná.

Související pojmy

Významové a tematické souvislosti

Zdroje a redakční stopa

Použitá východiska a odborná revize

  • Finite-time Analysis of the Multiarmed Bandit Problem Bandit Algorithms, Lattimore and Szepesvári

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.