Experimentování a hodnocení

A/B testování

A/B testing je kontrolovaný experiment, ve kterém se porovnávají dvě nebo více verzí produktu, modelu, promptu či rozhodovacího pravidla na náhodně rozdělených uživatelích nebo případech. Předem se určí primární metrika, hypotéza, minimálně významný efekt a způsob statistického vyhodnocení. Randomizace pomáhá oddělit účinek testované změny od sezónnosti, rozdílů mezi skupinami a dalších rušivých vlivů. Při sekvenčním sledování je třeba upravit inferenční postup, aby opakované nahlížení do výsledků nezvyšovalo falešnou pozitivitu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-A-01

Odborná definice

Odborná definice

A/B testing je kontrolovaný experiment, ve kterém se porovnávají dvě nebo více verzí produktu, modelu, promptu či rozhodovacího pravidla na náhodně rozdělených uživatelích nebo případech. Předem se určí primární metrika, hypotéza, minimálně významný efekt a způsob statistického vyhodnocení. Randomizace pomáhá oddělit účinek testované změny od sezónnosti, rozdílů mezi skupinami a dalších rušivých vlivů. Při sekvenčním sledování je třeba upravit inferenční postup, aby opakované nahlížení do výsledků nezvyšovalo falešnou pozitivitu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Představte si, že část zákazníků uvidí doporučení vytvořené starým modelem a druhá část doporučení z nového modelu. Obě skupiny musí být srovnatelné a rozdíl má být pouze v testované verzi. Potom se sleduje konkrétní výsledek, například dokončený nákup, přesnost odpovědi nebo počet reklamací. A/B test neříká pouze, která verze vyhrála, ale i zda zjištěný rozdíl pravděpodobně nevznikl náhodou. Při nesprávném designu může test místo odpovědi pouze potvrdit rozdíl, který vytvořila sezóna, segment nebo předčasné ukončení.

Časté otázky

Časté otázky

Proč je při A/B teste důležité náhodné rozdělení?

Náhodné přiřazení snižuje riziko, že jedna skupina bude mít více zkušených uživatelů, jiný typ zákazníků nebo odlišné časové podmínky. Bez randomizace se může změna metriky připsat nové verzi, ačkoli ji v skutečnosti způsobilo složení skupiny. U malých vzorků je třeba navíc kontrolovat, zda se klíčové charakteristiky skupin skutečně vyrovnaly.

Kterou metriku je třeba při A/B teste vybrat?

Primární metrika má přímo souviset s rozhodnutím, které má experiment podporit. Při AI asistente to může být úspěšné vyřešení úlohy bez eskalace, ne pouze délka konverzace. Vedlejší metriky sledují nežádoucí účinky, například latenci, náklady, stížnosti nebo bezpečnostní incidenty. Metriky je vhodné určit ještě před spuštěním testu.

Jako dlho má A/B test trvat?

Test má pokrýt dostatečný počet případů i typický provozní cyklus, například pracovní dni, víkendy nebo sezónní špičky. Ukončení pouze v okamihu, když výsledek poprvé vypadá příznivě, zvyšuje riziko falešného závěru. Délka se proto odvozuje od očekávaného efektu, variability metriky, požadované síly testu a praktických provozních omezení.

Může se A/B testing použít na porovnání AI modelů?

Ano, pokud oba modely řeší stejnou úlohu, dostávají srovnatelné vstupy a výsledek lze bezpečně měřit v reálném provozu. Před online testem se mají absolvovat offline testy kvality a bezpečnosti. Při vysoce rizikových rozhodnutích nelze experimentovat způsobem, který by jedné skupině záměrně poskytoval nepřiměřeně horší nebo neoverenou službu.

Jaký je rozdíl mezi A/B testem a ablačnou štúdiou?

A/B test typicky porovnává celé varianty v provozu nebo v kontrolovanom experimente. Ablační studie cíleně odebírá jednu součást modelu či pipeline, aby zistila její příspěvek. A/B test odpovídá, která verze přináší lepší výsledek pro uživatele. Ablace vysvětluje, která technická složka způsobuje pozorovaný výkon nebo chování.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Google Machine Learning Glossary
  • NIST AI Risk Management Framework

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.