เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสุ่มตัวอย่างจากการแจกแจงต่อเนื่องที่เหมาะสมที่สุด

การสุ่มตัวอย่างจากการแจกแจงความน่าจะเป็นที่เหมาะสมช่วยรักษาความเป็นส่วนตัวของข้อมูล ในขณะเดียวกันก็เปิดโอกาสให้ผู้ที่ได้รับอนุญาตวิเคราะห์ข้อมูลทางสถิติได้อย่างแม่นยำ

ในแบบฝึกหัดนี้ คุณจะทำการ anonymize คอลัมน์ monthly_income จากชุดข้อมูล IBM ในบทก่อนหน้า คุณได้ระบุว่าการแจกแจง exponnorm แบบต่อเนื่องเป็นตัวที่เหมาะสมที่สุด ให้ใช้การแจกแจงนี้สร้างโมเดลรายได้

ชุดข้อมูลพร้อมใช้งานในตัวแปร hr

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import โมดูล stats จากแพ็กเกจ scipy
  • Fit การแจกแจง exponnorm กับตัวแปรต่อเนื่อง monthly_income เพื่อดึงค่าพารามิเตอร์ของการแจกแจง สำหรับนำไปสร้างตัวอย่างในขั้นถัดไป
  • สุ่มตัวอย่างจากการแจกแจง exponnorm แล้วแทนที่ monthly_income โดยใช้เมธอด .rvs() พร้อมระบุขนาดให้เท่ากับความยาวของคอลัมน์
  • ปัดเงินเดือนให้เป็นจำนวนเต็มที่ใกล้เคียงที่สุด

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import stats from scipy
____

# Fit the exponnorm distribution to the continuous variable monthly income
params = ____

# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____

# Round the salaries to their closest integer
hr['monthly_income'] = ____

# See the resulting dataset
print(hr.head())
แก้ไขและรันโค้ด