국내법에 따른 정보의 분류
- 개인 정보
- 가명 정보
- 익명 정보
데이터 비식별화
데이터 내에 개인을 식별할 수 있는 정보가 존재하는 경우, 해당 정보의 일부 혹은 전부를 삭제 또는 대체하여 개인을 식별하기 어렵게끔 만드는 것
- 식별 방지를 통한 비식별화
- 추론 방지를 통한 비식별화
식별 방지 방법
Data Masking
ex) 010-1234-5678 → 010-1xx4-5xx8
Aggregation
평균, 중앙값, 최빈값, 최솟값, 최댓값 등 대푯값 하나로 모든 값을 통일.
Categorization
상위 개념으로 범주화. ex) Galaxy Z Fold4 / Galaxy S23 / Galaxy S24 → Galaxy / Galaxy / Galaxy
Rounding
올림, 내림, 반올림 등을 적용.
Controlled Rounding
Rounding 수행 전후로 데이터 누계가 달라지지 않게끔 제어.
Tokenization
토큰으로 암호화.
Noise Addition
원래 데이터에 노이즈 값을 추가.
Permutation
동질 집합 內 값들의 순서를 무작위로 재배열.
추론 방지 방법
k-annoymity
모든 준식별자가 자기 자신과 동일하여 구분이 불가능한 경우가 k개 이상 존재
- 동질성 공격: 동질 집단의 민감정보가 동일한 경우 민감정보가 파악될 수 있다.
- 배경지식 공격에 의해: 배경지식을 더해 개인을 식별할 수 있다.
l-diversity
준식별자가 동일해 구분이 불가능한 데이터들은 적어도 l개의 서로 다른 민감정보를 가져야 함. → 이를 통해 동질성 공격을 방지할 수 있다.
- 유사성 공격: 민감정보가 형식적 다양성만을 가진채 유사할 경우 대략의 민감정보를 파악할 수 있다.
- 쏠림 공격: 민감정보가 한쪽으로 쏠려 있을 경우, 확률적으로 민감정보를 추측할 수 있다.
recursive (c, l) diversity
l-다양성뿐만 아니라, 민감정보를 균질하게 하여 쏠림 공격을 방지한다.
(가) l-다양성을 가짐.
(나) 동질집합 內 민감정보 빈도의 내림차순이