or
이 연습은 강의의 일부입니다
데이터 억제(suppression), 마스킹(masking), 합성 데이터 생성, 일반화 같은 익명화 기법을 직접 적용할 준비를 해 보세요. 이 장에서는 민감 및 비민감 식별정보(PII), 준식별자(quasi-identifiers)를 구분하는 방법과 GDPR의 기초를 배웁니다. 또한 이러한 모범 사례를 지키지 않았을 때 실제로 어떤 문제가 생길 수 있는지 사례를 통해 확인합니다.
열의 확률 분포를 따르도록 데이터셋에서 샘플링해 데이터를 익명화하는 방법을 알아봅니다. 그런 다음 연결 공격이나 재식별 공격을 방지하기 위해 k-anonymity 프라이버시 모델을 적용하고, 범주형 변수에서 계층(hierarchy)을 사용해 데이터 일반화를 수행하는 방법을 배웁니다.
Apple, Google, Uber와 같은 주요 기술 기업이 사용하는 모델인 차등 프라이버시에 대해 학습합니다. 이 장에서는 프라이빗 히스토그램을 생성하고 프라이빗 평균을 계산해 데이터를 탐색해 봅니다. 또한 기업이 데이터 효용성을 높일 수 있도록 지원하는 차등 프라이빗 Machine Learning 모델을 만들어 봅니다.
마지막 장에서는 주성분분석(PCA)과 같은 차원 축소 기법을 적용해 다수 열을 가진 대규모 데이터셋을 익명화하는 방법을 배웁니다. 이어서 Faker를 사용해 현실적이고 일관된 데이터셋을 생성하고, scikit-learn으로 정규 분포를 따르는 합성 데이터셋을 만듭니다. 마지막으로, 강의 전반에서 학습한 내용을 종합해 여러 기법을 결합하고 데이터셋을 안전하게 대중에 공개하는 과정을 마무리합니다.
현재 연습