เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสุ่มตัวอย่างจากการแจกแจงความน่าจะเป็นเดิม

หลายองค์กร เช่น สำนักงานสำมะโนประชากรของสหรัฐอเมริกา เผยแพร่ตัวอย่างข้อมูลที่เก็บรวบรวมเกี่ยวกับประชาชนให้สาธารณชนได้เข้าถึง ชุดข้อมูลเหล่านี้จะถูกปกปิดข้อมูลก่อนด้วยเทคนิคต่าง ๆ จากนั้นจึงเผยแพร่เพียงส่วนเล็กน้อยประมาณ 1% ถึง 5% เพื่อให้สามารถนำไปคำนวณได้ การสุ่มตัวอย่างช่วยรักษาคุณลักษณะทางสถิติของข้อมูลไว้ ทำให้สามารถศึกษาและทำความเข้าใจประชากรกลุ่มเป้าหมายได้

ในแบบฝึกหัดนี้ จะทำการปกปิดข้อมูลในคอลัมน์ department ของชุดข้อมูล IBM HR โดยการสุ่มตัวอย่างจากการแจกแจงของชุดข้อมูลต้นฉบับ

ชุดข้อมูลถูกโหลดไว้ในตัวแปร hr แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ดึงความถี่สัมพัทธ์ของแต่ละค่าที่ไม่ซ้ำกันในคอลัมน์ department
  • ดึงค่าความน่าจะเป็นจาก counts และเก็บไว้ในตัวแปรชื่อ distributions
  • สุ่มตัวอย่างจากการแจกแจงความน่าจะเป็นที่คำนวณไว้ก่อนหน้า โดยขนาดของตัวอย่างควรเท่ากับขนาดของชุดข้อมูล hr

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Obtain the probability distribution counts 
counts = ____

# Get the probability distribution values 
distributions = ____

# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index, 
                                    p=____, 
                                    size=len(____))

# See the resulting DataFrame
print(hr.head())
แก้ไขและรันโค้ด