開始使用免費開始

建立差分隱私分類器

在這個練習中,你會在 Penguin 資料集上建立並訓練一個具隱私的 Gaussian Naive Bayes 模型,用來判斷企鵝是公的還是母的。

由於理論與實證上的種種限制(也就是所謂的「維度災難」),k-anonymity 在高維或多樣性的資料集上表現不佳。當特徵或維度的數量增加時,為了能夠準確地做泛化,所需的資料量會呈指數成長。這也是為什麼差分隱私成為目前較受青睞的隱私模型之一。Epsilon 與任何背景知識無關,並能對敏感資訊提供「上界」約束。

DataFrame 已載入為 penguin_df,並分割為 X_trainy_trainX_testy_test。私有模型類別已匯入為 dp_GaussianNB

本練習屬於課程

Data Privacy and Anonymization in Python

檢視課程

練習說明

  • 建立一個不帶參數的 dp_GaussianNB 分類器。
  • 將先前建立的模型以不帶參數的方式擬合到資料上。
  • 以測試資料計算此私有模型的分數。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Built the private classifier without parameters
dp_clf = ____

# Fit the model to the data
____(X_train, y_train)

# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))
編輯並執行程式碼