การทำ K-anonymity กับชุดข้อมูล
ในแบบฝึกหัดนี้ คุณจะทำการปกปิดข้อมูลในชุดข้อมูล NBA Salaries โดยต้องระบุประเภทของแอตทริบิวต์ก่อนจึงจะใช้ k-anonymity ได้ ซึ่งแอตทริบิวต์แต่ละตัวอาจเป็นแบบระบุตัวตน (identifying), กึ่งระบุตัวตน (quasi-identifying), ข้อมูลละเอียดอ่อน (sensitive) หรือข้อมูลไม่ละเอียดอ่อน (insensitive) ในที่นี้เราจะกำหนดให้ age และ nba_origin เป็น Quasi-identifying และ salary เป็นข้อมูลละเอียดอ่อน
ลองสำรวจ nba ดู หากมีข้อมูลเกี่ยวกับผู้เล่นคนหนึ่ง เช่น รู้ว่าเขา/เธอมาจากสเปนและอายุ 23 ปี คุณก็จะสามารถทราบข้อมูลละเอียดอ่อนอย่างเงินเดือนของเขา/เธอได้ทันที ที่นี่เราจะใช้ค่า K เท่ากับ 3 เพื่อให้แน่ใจว่าแอตทริบิวต์ที่เลือกไม่สามารถแยกแยะออกจากแถวอื่นได้อย่างน้อย k-1 แถว
พจนานุกรม hierarchy สำหรับ nba_Origin ถูกสร้างไว้แล้วในชื่อ origin_hierarchy
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print how many unique combinations are for age and nba_origin
print(____)