สร้าง classifier แบบ differential privacy
ในแบบฝึกหัดนี้ จะได้สร้างและฝึกโมเดล Gaussian Naive Bayes แบบ private บนชุดข้อมูล Penguin เพื่อจำแนกว่าเพนกวินเป็นเพศผู้หรือเพศเมีย
k-anonymity ไม่เหมาะกับชุดข้อมูลที่มีมิติสูงหรือมีความหลากหลายมาก เนื่องจากข้อจำกัดทั้งในเชิงทฤษฎีและเชิงประจักษ์ที่เรียกว่า "curse of dimensionality" เมื่อจำนวนฟีเจอร์หรือมิติเพิ่มขึ้น ปริมาณข้อมูลที่ต้องใช้เพื่อการ generalize ที่แม่นยำก็เพิ่มขึ้นแบบ exponential นี่คือเหตุผลหนึ่งที่ทำให้ differential privacy กลายเป็นโมเดลความเป็นส่วนตัวที่ได้รับความนิยมในปัจจุบัน โดย Epsilon นั้นเป็นอิสระจากความรู้พื้นฐานใด ๆ และทำหน้าที่ "จำกัด" ขอบเขตของข้อมูลที่ละเอียดอ่อน
DataFrame ถูกโหลดเป็น penguin_df และแบ่งออกเป็น X_train, y_train, X_test และ y_test โดยคลาสโมเดล private ถูก import มาในชื่อ dp_GaussianNB
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
คำแนะนำการฝึกหัด
- สร้าง classifier แบบ
dp_GaussianNBโดยไม่ต้องระบุพารามิเตอร์ - Fit โมเดลที่สร้างไว้กับข้อมูลโดยไม่ต้องระบุพารามิเตอร์ใด ๆ
- คำนวณคะแนนของโมเดล private โดยใช้ข้อมูล test
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))