建立差分隱私分類器
在這個練習中,你會在 Penguin 資料集上建立並訓練一個具隱私的 Gaussian Naive Bayes 模型,用來判斷企鵝是公的還是母的。
由於理論與實證上的種種限制(也就是所謂的「維度災難」),k-anonymity 在高維或多樣性的資料集上表現不佳。當特徵或維度的數量增加時,為了能夠準確地做泛化,所需的資料量會呈指數成長。這也是為什麼差分隱私成為目前較受青睞的隱私模型之一。Epsilon 與任何背景知識無關,並能對敏感資訊提供「上界」約束。
DataFrame 已載入為 penguin_df,並分割為 X_train、y_train、X_test 和 y_test。私有模型類別已匯入為 dp_GaussianNB。
本練習屬於課程
Data Privacy and Anonymization in Python
練習說明
- 建立一個不帶參數的
dp_GaussianNB分類器。 - 將先前建立的模型以不帶參數的方式擬合到資料上。
- 以測試資料計算此私有模型的分數。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))