or
本练习是课程的一部分
准备好应用匿名化技术,如数据抑制、掩码、合成数据生成和泛化。在本章中,您将学习区分敏感与非敏感的可识别个人信息(PII)、准标识符,以及 GDPR 的基础知识。您还将看到真实案例,了解不遵循这些最佳实践会带来哪些问题。
了解如何通过按列的概率分布进行采样来实现数据匿名化。随后,您将学习应用 k-匿名隐私模型,防止关联或再识别攻击,并使用层级对分类变量执行数据泛化。
学习差分隐私——Apple、Google 和 Uber 等大型科技公司采用的模型。在本章中,您将通过生成私有直方图和计算私有平均值来探索数据。您还将创建差分隐私的机器学习模型,帮助企业在保障隐私的同时提升数据效用。
当前练习
在最后一章中,您将学习应用降维方法(如主成分分析,PCA)来匿名化大型多列数据集。随后,您将使用 Faker 生成逼真且一致的数据集,并用 scikit-learn 创建服从正态分布的合成数据集。最后,您将把本课程所学整合起来,结合多种技术,安全地向公众发布数据集。