เตรียมข้อมูลพนักงานเพื่อเผยแพร่อย่างปลอดภัย
เมื่อทำงานกับข้อมูลจริง สิ่งสำคัญคือต้องมั่นใจว่าไม่มีทางที่ข้อมูลส่วนบุคคลของลูกค้าหรือบุคคลอื่นจะถูกติดตามหรือเปิดเผยได้ ในแบบฝึกหัดนี้ จะใช้ชุดข้อมูลพนักงาน IBM HR Analytics เวอร์ชันที่ลดความซับซ้อนแล้ว เพื่อฝึกเทคนิคการระงับข้อมูล (suppression) และการทำข้อมูลให้เป็นกลุ่ม (generalization)
เพื่อป้องกันการรั่วไหลของข้อมูล จะแทนชื่อคอลัมน์ด้วยตัวเลข
โหลด DataFrame ไว้เป็น hr แล้ว ใช้คอนโซลสำรวจข้อมูลได้เลย โดย numpy นำเข้าไว้เป็น np
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____