Data, soukromí a simulace

syntetická data

Synthetic data jsou uměle vytvořené záznamy, obrazy, texty, signály nebo scénáře, které napodobňují vybrané vlastnosti reálných dat nebo vznikají ze simulace. Používají se na rozšíření vzácných tříd, testování, ochranu soukromí a trénink v situacích, kde reálně data chýbají. Syntetickosť sama sám o sobě nezaručuje anonymitu, reprezentatívnost ani absenci autorských a licenčných problémů. Hodnotí se užitečnost, podobnost distribúcií, memorování a riziko úniku. Důležitý je i podíl syntetických příkladů, protože příliš mnoho generovaných dat může zúžiť variabilitu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-S-24

Odborná definice

Odborná definice

Synthetic data jsou uměle vytvořené záznamy, obrazy, texty, signály nebo scénáře, které napodobňují vybrané vlastnosti reálných dat nebo vznikají ze simulace. Používají se na rozšíření vzácných tříd, testování, ochranu soukromí a trénink v situacích, kde reálně data chýbají. Syntetickosť sama sám o sobě nezaručuje anonymitu, reprezentatívnost ani absenci autorských a licenčných problémů. Hodnotí se užitečnost, podobnost distribúcií, memorování a riziko úniku. Důležitý je i podíl syntetických příkladů, protože příliš mnoho generovaných dat může zúžiť variabilitu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud firma nemá dosť příkladů poruchy stroja, může simulovat senzory při různých typoch selhání. Získá více tréninkových situací bez čakání na skutečnou haváriu. Při tabulkových datech může generátor vytvořit nové řádky s podobnými štatistikami jako původná databáze. Takéto řádky však mohou kopírovat vzácnu osobu, vynechat nečakaný jev nebo zosilnit predsudok zdroje. Syntetická data musí být testované vůči účelu a porovnané s reálnou prevádzkou. Syntetická zbierka je najcennejšia tehdy, když cíleně pokrývá případy, které reálně data obsahují málo nebo vůbec.

Časté otázky

Časté otázky

Jsou syntetická data automaticky anonymné?

Ne. Generátor může memorovat tréninková záznamy nebo zachovat kombinace, které identifikují jednotlivca. Soukromí se hodnotí útoky, analýzou podobnosti a případně diferenciálnou ochranou.

Jak se měří utility syntetických dat?

Porovnává se distribuce vlastností, korelace, pokrytí vzácných případů a výkon modelu trénovaného na syntetických datech při testování na reálných datech.

Co je sim-to-real gap?

Je to rozdíl mezi simulovaným a skutočným prostredím. Model může využit artefakty simulátora a po nasazení selhat na fyzike, textúrach nebo správaní, které simulace nevystihla.

Mohou syntetická data opravit nevyvážené třídy?

Mohou doplnit menšinové případy, ale generátor potřebuje dostatečný základ, aby nevytváral stereotypné kopie. Výsledek se kontroluje na reálných příkladech menšinové třídy.

Jak se dokumentuje původ syntetických dat?

Zaznamenáva se zdroj seed dat, generátor, verze, prompty nebo parametry simulace, filtry, licence, podíl syntetických záznamů a testy kvality a soukromí.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • NIST Glossary, synthetic data generation SDNist Synthetic Data Report Tool

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.