Odborná definícia
Odborná definícia
K-anonymita je vlastnosť zverejneného dátového súboru, pri ktorej je každý záznam podľa zvolených kvázi-identifikátorov nerozoznateľný najmenej od k mínus jedného ďalšieho záznamu. Dosahuje sa najmä zovšeobecnením hodnôt, potlačením atribútov alebo tvorbou ekvivalenčných tried. Nechráni automaticky citlivý atribút v skupine, nebráni všetkým útokom s pomocnými dátami a jej účinnosť závisí od správneho výberu kvázi-identifikátorov. Riziko sa preto hodnotí pre konkrétny spôsob zverejnenia, nie iba jedným číslom k.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Predstavte si tabuľku pacientov bez mien, ale s vekom, obcou a povolaním. Ak kombinácia 47 rokov, malá obec a konkrétne povolanie patrí jedinému človeku, záznam sa dá spätne priradiť. Pri k rovnom 5 sa údaje upravia tak, aby rovnakú kombináciu malo aspoň päť osôb, napríklad vek sa zmení na interval a obec na okres. Výsledok znižuje riziko priameho prepojenia, no ak všetkých päť ľudí zdieľa rovnakú diagnózu, citlivá informácia môže zostať odhaliteľná. Pred publikovaním sa preto skúša viac kombinácií externých registrov, nie iba odstránenie mena.
Časté otázky
Časté otázky
Čo presne znamená parameter k?
Určuje minimálny počet záznamov v každej ekvivalenčnej triede vytvorenej podľa kvázi-identifikátorov. Pri k rovnom 10 má každý publikovaný profil najmenej deväť ďalších záznamov s rovnakou kombináciou týchto atribútov.
Ktoré polia sú kvázi-identifikátory?
Sú to údaje, ktoré nemusia byť samy osebe jedinečné, ale po spojení s externými zdrojmi môžu identifikovať osobu. Typické sú vek, PSČ, pohlavie, pracovná pozícia, dátum udalosti alebo presnejšia lokalita.
Prečo k-anonymita nestačí pri rovnakých citlivých hodnotách?
Ak všetci členovia jednej skupiny majú rovnakú diagnózu, príjem alebo iný citlivý atribút, útočník ho môže odvodiť aj bez určenia konkrétneho riadku. Tento problém riešia doplnkové koncepty, napríklad l-diverzita a t-blízkosť.
Ako k-anonymita ovplyvňuje využiteľnosť dát pre AI?
Silnejšie zovšeobecnenie znižuje presnosť a variabilitu atribútov, takže model môže stratiť lokálne vzory alebo menšinové signály. Hodnota k sa preto volí spolu s meraním informačnej straty a výkonom modelu na zamýšľanej úlohe.
Je k-anonymita to isté ako anonymizácia?
Nie. Je to konkrétne kritérium pre určitý model útočníka a určitú sadu atribútov. Právne alebo praktické označenie dát za anonymné vyžaduje širšie posúdenie dostupných pomocných informácií, kontextu zverejnenia a pravdepodobnosti opätovnej identifikácie.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- NIST CSRC, k-anonymity
- NIST, De-Identification of Personal Information
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
