เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สำรวจการกระจายตัวของข้อมูล

เมื่อต้องการทำให้ชุดข้อมูลไม่ระบุตัวตนด้วยการสุ่มตัวอย่างข้อมูลให้สมจริงที่สุด เราจำเป็นต้องมีความรู้ด้านโดเมนและสถิติของข้อมูลนั้น ๆ ดังที่ได้เห็นไปแล้ว การหาการกระจายความน่าจะเป็นของคอลัมน์ที่สนใจถือเป็นขั้นตอนสำคัญ

ในแบบฝึกหัดนี้ จะได้สำรวจคอลัมน์ business_travel จากชุดข้อมูล IBM HR เวอร์ชันที่ลดขนาดลง

ได้นำเข้า DataFrame ในชื่อ hr และ numpy ในชื่อ np แล้ว และเช่นเดียวกับบทก่อนหน้า ได้นำเข้า pandas ในชื่อ pd สำหรับแบบฝึกหัดนี้และที่เหลือตลอดทั้งคอร์ส

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print the absolute frequencies of each unique value
print(____)
แก้ไขและรันโค้ด