การแบ่งข้อมูลเป็นช่วง
K-anonymity เป็นโมเดลความเป็นส่วนตัวที่เหมาะกับชุดข้อมูลที่มีมิติไม่มากนัก เทคนิคการทำให้ข้อมูลไม่ระบุตัวตนหลักสองแบบที่ใช้แปลงชุดข้อมูลให้เป็นตาราง k-anonymous ได้แก่ การทำให้ข้อมูลเป็นแบบทั่วไป (generalization) และการระงับข้อมูล (suppression)
ในแบบฝึกหัดนี้ จะแปลงชุดข้อมูลคะแนนความพึงพอใจให้เป็นตาราง 3-anonymous ซึ่งมีแอตทริบิวต์ที่อาจเป็นข้อมูลส่วนตัว เช่น satisfaction_rate และ work_hours โดยบางชุดค่าผสมปรากฏน้อยกว่า 3 ครั้ง ให้แก้ไขส่วนนี้เพื่อทำให้ DataFrame เป็น 3-anonymous
DataFrame พร้อมใช้งานในชื่อ employees และค่า k กำหนดไว้เป็น 3
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Calculate how many unique combinations are for BirthYear and Department
print(employees.groupby(['birth_year','department']).____)