Štatistické predpoklady a generalizácia

Independent and identically distributed data

Nezávislé a rovnako rozdelené dáta

Independent and identically distributed data, skrátene i.i.d., označujú vzorky, pri ktorých je každý pozorovaný príklad generovaný z rovnakej pravdepodobnostnej distribúcie a jeho hodnota nie je závislá od ostatných príkladov. Predpoklad zjednodušuje odhad generalizačnej chyby, náhodné delenie datasetu a mnohé teoretické výsledky učenia. Reálne dáta ho často porušujú časovou následnosťou, opakovanými osobami, skupinami, priestorovou blízkosťou alebo zmenou prostredia. Náhodný split potom môže preniesť takmer rovnaké prípady do tréningu aj testu a vytvoriť optimistický výkon. Spôsob validácie sa musí prispôsobiť jednotke nezávislosti a budúcemu nasadeniu.

Posledná odborná revízia
29. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-I-13

Odborná definícia

Odborná definícia

Independent and identically distributed data, skrátene i.i.d., označujú vzorky, pri ktorých je každý pozorovaný príklad generovaný z rovnakej pravdepodobnostnej distribúcie a jeho hodnota nie je závislá od ostatných príkladov. Predpoklad zjednodušuje odhad generalizačnej chyby, náhodné delenie datasetu a mnohé teoretické výsledky učenia. Reálne dáta ho často porušujú časovou následnosťou, opakovanými osobami, skupinami, priestorovou blízkosťou alebo zmenou prostredia. Náhodný split potom môže preniesť takmer rovnaké prípady do tréningu aj testu a vytvoriť optimistický výkon. Spôsob validácie sa musí prispôsobiť jednotke nezávislosti a budúcemu nasadeniu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak predpovedáte spotrebu elektriny, merania z nasledujúcich minút spolu silno súvisia a zimné dáta nemajú rovnaké rozdelenie ako letné. Náhodné premiešanie riadkov by dovolilo modelu vidieť veľmi podobné okamihy v tréningu aj teste. Výsledok by vyzeral lepšie, než pri skutočnej predikcii budúceho mesiaca. Podobne desať snímok jedného pacienta nie je desať nezávislých ľudí. Správny test preto oddeľuje celé časové obdobia, pacientov, zariadenia alebo lokality podľa toho, kde sa očakáva nový vstup. i.i.d. je užitočný model, nie automatická vlastnosť tabuľky.

Časté otázky

Časté otázky

Čo znamená identically distributed?

Každá vzorka má pochádzať z rovnakého rozdelenia pravdepodobností. Neznamená to rovnaké hodnoty, ale rovnaký proces, ktorý určuje ich možné hodnoty a frekvencie.

Ako sa poruší nezávislosť pri skupinových dátach?

Viaceré záznamy jedného používateľa, pacienta alebo stroja zdieľajú latentné vlastnosti. Ak sa skupina rozdelí medzi tréning a test, model môže rozpoznávať identitu namiesto všeobecného vzoru.

Prečo časové rady nemožno bežne náhodne premiešať?

Budúce pozorovania môžu ovplyvňovať minulé okno iba nepriamo, no náhodný split mieša sezóny a susedné okamihy. Validácia má zachovať smer času a simulovať predikciu dopredu.

Je stochastic gradient descent závislý od i.i.d. dát?

Mnohé analýzy predpokladajú nezávislé vzorkovanie mini-batchov, ale algoritmus sa používa aj pri závislých dátach. Konvergencia a odhad neistoty však môžu mať iné vlastnosti.

Ako sa testuje distribučný posun?

Porovnávajú sa vlastnosti, labely, embeddingy a výkon medzi obdobiami alebo prostrediami. Samotný štatistický test nestačí, treba posúdiť, či rozdiel mení rozhodovaciu úlohu.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • Google Machine Learning Glossary, i.i.d. (developers.google.com)
  • Stanford CS229, Machine Learning course notes (cs229.stanford.edu)

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.