การสุ่มตัวอย่างจากการแจกแจงความน่าจะเป็นเดิม
หลายองค์กร เช่น สำนักงานสำมะโนประชากรของสหรัฐอเมริกา เผยแพร่ตัวอย่างข้อมูลที่เก็บรวบรวมเกี่ยวกับประชาชนให้สาธารณชนได้เข้าถึง ชุดข้อมูลเหล่านี้จะถูกปกปิดข้อมูลก่อนด้วยเทคนิคต่าง ๆ จากนั้นจึงเผยแพร่เพียงส่วนเล็กน้อยประมาณ 1% ถึง 5% เพื่อให้สามารถนำไปคำนวณได้ การสุ่มตัวอย่างช่วยรักษาคุณลักษณะทางสถิติของข้อมูลไว้ ทำให้สามารถศึกษาและทำความเข้าใจประชากรกลุ่มเป้าหมายได้
ในแบบฝึกหัดนี้ จะทำการปกปิดข้อมูลในคอลัมน์ department ของชุดข้อมูล IBM HR โดยการสุ่มตัวอย่างจากการแจกแจงของชุดข้อมูลต้นฉบับ
ชุดข้อมูลถูกโหลดไว้ในตัวแปร hr แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
คำแนะนำการฝึกหัด
- ดึงความถี่สัมพัทธ์ของแต่ละค่าที่ไม่ซ้ำกันในคอลัมน์
department - ดึงค่าความน่าจะเป็นจาก
countsและเก็บไว้ในตัวแปรชื่อdistributions - สุ่มตัวอย่างจากการแจกแจงความน่าจะเป็นที่คำนวณไว้ก่อนหน้า โดยขนาดของตัวอย่างควรเท่ากับขนาดของชุดข้อมูล
hr
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Obtain the probability distribution counts
counts = ____
# Get the probability distribution values
distributions = ____
# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index,
p=____,
size=len(____))
# See the resulting DataFrame
print(hr.head())