Odborná definice
Odborná definice
K-anonymita je vlastnost zverejneného datového souboru, při které je každý záznam podle zvolených kvázi-identifikátorů nerozoznatelný nejméně od k mínus jednoho dalšího záznamu. Dosahuje se zejména zovšeobecnením hodnot, potlačením atributů nebo tvorbou ekvivalenčných tříd. Nechráni automaticky citlivý atribút v skupině, nebráni všem útokům s pomocnými daty a její účinnost závisí na správného výběru kvázi-identifikátorů. Riziko se proto hodnotí pro konkrétní způsob zverejnení, ne pouze jedním číslem k.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Představte si tabulku pacientů bez mien, ale s vekom, obcou a povoláním. Pokud kombinace 47 roků, malá obec a konkrétně povolání patří jedinému člověku, záznam se dá spetne přiřadit. Při k rovnom 5 se údaje upravia tak, aby stejnou kombinaci malo aspoň peť osůb, například vek se změní na interval a obec na okres. Výsledek snižuje riziko přímého propojení, ale pokud všech peť lidí zdiela stejnou diagnózu, citlivá informace může zůstat odhalitelná. Před publikováním se proto zkouší více kombinací externích registrů, ne pouze odstranění mena.
Časté otázky
Časté otázky
Co přesně znamená parameter k?
Určuje minimální počet záznamů v každé ekvivalenčnej třídě vytvorenej podle kvázi-identifikátorů. Při k rovnom 10 má každý publikovaný profil nejméně deveť dalších záznamů s stejnou kombinací těchto atributů.
Které pole jsou kvázi-identifikátory?
Jsou to údaje, které nemusí být samy sám o sobě jedinečné, ale po spojení s externými zdroji mohou identifikovat osobu. Typické jsou vek, PSČ, pohlavie, pracovná pozíce, datum události nebo presnejšia lokalita.
Proč k-anonymita nestačí při stejných citlivých hodnotách?
Pokud všetci členovia jedné skupiny mají stejnou diagnózu, příjem nebo jiný citlivý atribút, útočník ho může odvodit i bez určení konkrétního řádku. Tento problém řeší doplnkové koncepty, například l-diverzita a t-blízkost.
Jako k-anonymita ovlivňuje využitelnost dat pro AI?
Silnější zovšeobecnení snižuje přesnost a variabilitu atributů, takže model může stratit lokálně vzory nebo menšinové signály. Hodnota k se proto volí spolu s meráním informační ztráty a výkonem modelu na zamýšlanej úloze.
Je k-anonymita to jisté jako anonymizace?
Ne. Je to konkrétně kritérium pro určitý model útočníka a určitou sadu atributů. Právně nebo praktické označení dat za anonymné vyžaduje šířeji posouzení dostupných pomocných informací, kontextu zverejnení a pravděpodobnosti opetovnej identifikace.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- NIST CSRC, k-anonymity
- NIST, De-Identification of Personal Information
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
