ชุดข้อมูลสังเคราะห์ที่สอดคล้องกัน
หนึ่งในสถานการณ์ที่บริษัทต่างๆ นำข้อมูลสังเคราะห์มาใช้คือการฝึกโมเดล AI และ Machine Learning ข้อมูลจริงบางครั้งมีต้นทุนสูงในการรวบรวม หรือหาได้ยาก เมื่อข้อมูลสำหรับฝึกมีความไม่สมดุลอย่างมาก (เช่น มากกว่า 90% ของข้อมูลอยู่ในกลุ่มเดียว) การสร้างข้อมูลสังเคราะห์จะช่วยให้สร้างโมเดล Machine Learning ที่แม่นยำได้
ในแบบฝึกหัดนี้ จะได้สร้างชุดข้อมูลคะแนนแอปมือถือโดยใช้ Faker
DataFrame เริ่มต้นถูกโหลดไว้เป็น ratings ซึ่งมีสองคอลัมน์ ได้แก่ rating และ gender และมีการสร้าง generator Faker() ไว้ให้แล้วในชื่อ fake_data
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ความเป็นส่วนตัวของข้อมูลและการทำให้ข้อมูลไม่ระบุตัวตนด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]