Odborná definice
Odborná definice
Independent and identically distributed data, zkráceně i.i.d., označují vzorku, při kterých je každý pozorovaný příklad generovaný z stejné pravdepodobnostnej distribuce a jeho hodnota není závislá od ostatních příkladů. Předpoklad zjednodušuje odhad generalizačnej chyby, náhodné dělení datasetu a mnohé teoretické výsledky učení. Reálně data ho často porušují časovou následností, opakovanými osobami, skupinami, prostorovou blízkosťou nebo změnou prostředí. Náhodný split potom může přenést téměř stejné případy do tréninku i testu a vytvořit optimistický výkon. Způsob validace se musí přizpůsobit jednotke nezávislosti a budúcemu nasazení.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Pokud predpovedáte spotrebu elektriny, měření z nasledujúcich minút spolu silně súvise a zimné data nemají stejné rozdělení jako letné. Náhodné premiešání riadků by dovolilo modelu vidět velmi podobné okamihy v tréninku i teste. Výsledek by vyzeral lépe, než při skutečné predikci budúceho mesiaca. Podobně deset snímků jednoho pacienta není deset nezávislých lidí. Správný test proto oddeluje celé časové období, pacientů, zařízení nebo lokality podle toho, kde se očekává nový vstup. i.i.d. je užitečný model, ne automatická vlastnost tabulky.
Časté otázky
Časté otázky
Co znamená identically distributed?
Každá vzorek má pochádzat z stejného rozdělení pravděpodobností. Neznamená to stejné hodnoty, ale stejný proces, který určuje jejich možné hodnoty a frekvence.
Jak se poruší nezávislost při skupinových datech?
Více záznamy jednoho uživatele, pacienta nebo stroja zdielají latentní vlastnosti. Pokud se skupina rozdělí mezi trénink a test, model může rozpoznávat identitu místo obecného vzoru.
Proč časové rady nelze běžně náhodně premiešat?
Budoucí pozorování mohou ovplyvňovat minulé okno pouze nepřímo, ale náhodný split mieša sezóny a sousední okamihy. Validace má zachovat směr času a simulovat predikci dopredu.
Je stochastic gradient descent závislý od i.i.d. dat?
Mnohé analýzy predpokladají nezávislé vzorkování mini-batchů, ale algoritmus se používá i při závislých datech. Konvergence a odhad nejistoty však mohou mít jiné vlastnosti.
Jak se testuje distribučný posun?
Porovnávají se vlastnosti, labely, embeddingy a výkon mezi obdobiami nebo prostrediami. Samotný statistický test nestačí, je třeba posoudit, či rozdíl mění rozhodovací úlohu.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- Google Machine Learning Glossary, i.i.d. (developers.google.com)
- Stanford CS229, Machine Learning course notes (cs229.stanford.edu)
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
