Odborná definícia
Odborná definícia
Upper Confidence Bound, skrátene UCB, je princíp sekvenčného rozhodovania, ktorý pre každú akciu kombinuje odhad očakávanej odmeny s bonusom za neistotu. Algoritmus vyberá akciu s najvyššou hornou hranicou, čím prirodzene vyvažuje exploitation známych možností a exploration málo preskúmaných možností. Bonus klesá s počtom pozorovaní danej akcie a rastie s časom alebo štatistickou neistotou. Teoretické regret záruky platia len pri konkrétnych predpokladoch o odmenách a stacionarite. Implementácia sa dokumentuje presným tvarom bonusu, inicializáciou ramien, horizontom a pravidlom pri rovnosti indexov.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Predstavte si päť reklamných variantov. Jeden má dobrý priemer z tisíc zobrazení, druhý o trochu slabší priemer, ale iba z desiatich. UCB pridá menej otestovanému variantu bonus, pretože jeho skutočný potenciál je ešte neistý. Ak sa ukáže slabý, bonus postupne klesne. Ak je silný, systém ho začne využívať. Metóda tak neskúša náhodne navždy ani sa príliš skoro nezamkne na prvý víťazný variant. Pri sezónnych zmenách však staré priemery môžu zavádzať. Online experiment má chrániť používateľov obmedzeniami, pretože exploration vedome skúša aj možnosti s menej známym výsledkom.
Časté otázky
Časté otázky
Čo predstavuje exploration bonus v UCB?
Je to funkcia neistoty odhadu odmeny, často závislá od logaritmu času a počtu výberov akcie. Menej skúšaná akcia dostane väčší bonus.
Ako sa UCB líši od epsilon-greedy?
Epsilon-greedy skúma náhodnú akciu s pevnou pravdepodobnosťou. UCB cieli exploration na možnosti, pri ktorých je vysoká neistota a zároveň realistický potenciál.
Čo je regret pri bandit algoritmoch?
Kumulovaný rozdiel medzi odmenou optimálnej akcie a odmenou skutočne zvolených akcií. UCB sa navrhuje tak, aby regret rástol sublineárne.
Funguje UCB pri meniacom sa prostredí?
Klasická verzia predpokladá stacionárne odmeny. Pri drifte sa používajú kĺzavé okná, discounting, change detection alebo iné non-stationary bandit metódy.
Kde sa UCB používa v aplikačnej AI?
Pri odporúčaniach, online experimentoch, výbere obsahu, alokácii rozpočtu a stromovom vyhľadávaní, ak sa výsledky pozorujú postupne a exploration je prípustná.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- Finite-time Analysis of the Multiarmed Bandit Problem Bandit Algorithms, Lattimore and Szepesvári
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
