เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สร้าง classifier แบบ differential privacy

ในแบบฝึกหัดนี้ จะได้สร้างและฝึกโมเดล Gaussian Naive Bayes แบบ private บนชุดข้อมูล Penguin เพื่อจำแนกว่าเพนกวินเป็นเพศผู้หรือเพศเมีย

k-anonymity ไม่เหมาะกับชุดข้อมูลที่มีมิติสูงหรือมีความหลากหลายมาก เนื่องจากข้อจำกัดทั้งในเชิงทฤษฎีและเชิงประจักษ์ที่เรียกว่า "curse of dimensionality" เมื่อจำนวนฟีเจอร์หรือมิติเพิ่มขึ้น ปริมาณข้อมูลที่ต้องใช้เพื่อการ generalize ที่แม่นยำก็เพิ่มขึ้นแบบ exponential นี่คือเหตุผลหนึ่งที่ทำให้ differential privacy กลายเป็นโมเดลความเป็นส่วนตัวที่ได้รับความนิยมในปัจจุบัน โดย Epsilon นั้นเป็นอิสระจากความรู้พื้นฐานใด ๆ และทำหน้าที่ "จำกัด" ขอบเขตของข้อมูลที่ละเอียดอ่อน

DataFrame ถูกโหลดเป็น penguin_df และแบ่งออกเป็น X_train, y_train, X_test และ y_test โดยคลาสโมเดล private ถูก import มาในชื่อ dp_GaussianNB

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง classifier แบบ dp_GaussianNB โดยไม่ต้องระบุพารามิเตอร์
  • Fit โมเดลที่สร้างไว้กับข้อมูลโดยไม่ต้องระบุพารามิเตอร์ใด ๆ
  • คำนวณคะแนนของโมเดล private โดยใช้ข้อมูล test

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Built the private classifier without parameters
dp_clf = ____

# Fit the model to the data
____(X_train, y_train)

# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))
แก้ไขและรันโค้ด