ชุดข้อมูลที่มีการกระจายเชิงความน่าจะเป็นเหมือนกัน
เป้าหมายของข้อมูลสังเคราะห์คือการสร้างชุดข้อมูลที่สมจริงที่สุดเท่าที่จะเป็นไปได้ โดยไม่เปิดเผยข้อมูลส่วนบุคคลที่สำคัญ ตัวอย่างเช่น ทีมงานของ Deloitte Consulting สร้างข้อมูลฝึกสอน 80% สำหรับโมเดล machine learning ด้วยการสังเคราะห์ข้อมูล และโมเดลที่ได้มีความแม่นยำใกล้เคียงกับโมเดลที่ฝึกบนข้อมูลจริง
ในแบบฝึกหัดนี้ จะได้สร้างชุดข้อมูลสังเคราะห์ขึ้นใหม่ตั้งแต่ต้นโดยใช้ Faker ที่ปฏิบัติตามการกระจายเชิงความน่าจะเป็นที่โหลดไว้เป็น p
ตัวสร้างข้อมูล Faker ชื่อ fake_data ถูกกำหนดค่าเริ่มต้นไว้แล้ว และนำเข้า numpy เป็น np
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)