构建差分隐私分类器
在本练习中,您将基于 Penguin 数据集构建并训练一个私有的高斯朴素贝叶斯模型,用于判断企鹅的性别(雄性或雌性)。
由于显著的理论与实证局限性("维度灾难"),k-匿名在高维或多样性强的数据集上效果不佳。随着特征或维度数量的增加,为了实现准确泛化所需的数据量会呈指数级增长。这也是差分隐私成为当前首选隐私模型的原因之一。Epsilon 与任何背景知识无关,并为敏感信息提供"界限"。
penguin_df DataFrame 已加载,并拆分为 X_train、y_train、X_test 和 y_test。私有模型类已按 dp_GaussianNB 导入。
本练习是课程的一部分
Python 中的数据隐私与匿名化
练习说明
- 创建一个不带参数的
dp_GaussianNB分类器。 - 将前面创建的模型在数据上进行拟合,不传入任何参数。
- 基于测试数据计算该私有模型的得分。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))