จัดการความเบ้ของข้อมูล
โหลดชุดข้อมูลเดิมชื่อ data ไว้ให้แล้ว เป้าหมายของแบบฝึกหัดนี้คือการกำจัดความเบ้ออกจาก var2 และ var3 ซึ่งมีการกระจายที่ไม่สมมาตรตามที่เห็นในพล็อตแบบฝึกหัดก่อนหน้า จากนั้นจะนำข้อมูลมาแสดงผลเพื่อยืนยันว่าแก้ปัญหาได้แล้ว
โหลดไลบรารี pandas, numpy, seaborn และ matplotlib.pyplot ไว้เป็น pd, np, sns และ plt ตามลำดับ สามารถสำรวจชุดข้อมูลใน console ได้ตามต้องการ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การแบ่งกลุ่มลูกค้าด้วย Python
คำแนะนำการฝึกหัด
- ใช้การแปลงลอการิทึมกับ
var2แล้วเก็บผลลัพธ์ไว้เป็นตัวแปรใหม่ชื่อvar2_log - ใช้การแปลงลอการิทึมกับ
var3แล้วเก็บผลลัพธ์ไว้เป็นตัวแปรใหม่ชื่อvar3_log - พล็อตการกระจายของ
var2_log - พล็อตการกระจายของ
var3_log
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Apply log transformation to var2
data['____'] = np.____(data['____'])
# Apply log transformation to var3
data['____'] = ____.____(____)
# Create a subplot of the distribution of var2_log
plt.____(2, 1, 1); ____.____(data['____'])
# Create a subplot of the distribution of var3_log
plt.____(2, 1, 2); ____.____(data['____'])
# Show the plot
plt.show()