การสุ่มตัวอย่างจากการแจกแจงต่อเนื่องที่เหมาะสมที่สุด
การสุ่มตัวอย่างจากการแจกแจงความน่าจะเป็นที่เหมาะสมช่วยรักษาความเป็นส่วนตัวของข้อมูล ในขณะเดียวกันก็เปิดโอกาสให้ผู้ที่ได้รับอนุญาตวิเคราะห์ข้อมูลทางสถิติได้อย่างแม่นยำ
ในแบบฝึกหัดนี้ คุณจะทำการ anonymize คอลัมน์ monthly_income จากชุดข้อมูล IBM ในบทก่อนหน้า คุณได้ระบุว่าการแจกแจง exponnorm แบบต่อเนื่องเป็นตัวที่เหมาะสมที่สุด ให้ใช้การแจกแจงนี้สร้างโมเดลรายได้
ชุดข้อมูลพร้อมใช้งานในตัวแปร hr
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
คำแนะนำการฝึกหัด
- Import โมดูล
statsจากแพ็กเกจscipy - Fit การแจกแจง
exponnormกับตัวแปรต่อเนื่องmonthly_incomeเพื่อดึงค่าพารามิเตอร์ของการแจกแจง สำหรับนำไปสร้างตัวอย่างในขั้นถัดไป - สุ่มตัวอย่างจากการแจกแจง
exponnormแล้วแทนที่monthly_incomeโดยใช้เมธอด.rvs()พร้อมระบุขนาดให้เท่ากับความยาวของคอลัมน์ - ปัดเงินเดือนให้เป็นจำนวนเต็มที่ใกล้เคียงที่สุด
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import stats from scipy
____
# Fit the exponnorm distribution to the continuous variable monthly income
params = ____
# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____
# Round the salaries to their closest integer
hr['monthly_income'] = ____
# See the resulting dataset
print(hr.head())