การเปรียบเทียบ Density Plot
การอิมพิวต์ข้อมูลแบบต่าง ๆ ที่ได้ทำไปก่อนหน้านี้ สามารถนำมาเปรียบเทียบกันได้ผ่าน density plot จากกราฟเหล่านี้ จะสามารถวิเคราะห์และระบุได้ว่าชุดข้อมูลใดมีการกระจายที่ใกล้เคียงกับชุดข้อมูลต้นฉบับมากที่สุด นอกจากนี้ยังช่วยให้เห็นได้ว่าการอิมพิวต์อาจทำให้ข้อมูลเกิดความเอนเอียงได้อย่างไร
ในแบบฝึกหัดนี้ จะเปรียบเทียบ density plot ของ DataFrame ที่ผ่านการอิมพิวต์ข้อมูลของ diabetes ที่สร้างไว้ก่อนหน้านี้
DataFrame ได้แก่ diabetes_cc, diabetes_mean_imputed, diabetes_knn_imputed และ diabetes_mice_imputed ถูกโหลดไว้ให้แล้ว พร้อมกับ matplotlib.pyplot ในชื่อ plt
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลที่หายไปใน Python
คำแนะนำการฝึกหัด
- พล็อต density plot สำหรับคอลัมน์
'Skin_Fold'ของแต่ละ DataFrame - กำหนดป้ายกำกับโดยใช้ลิสต์
labels - กำหนดป้ายกำกับแกน x เป็น
'Skin Fold'
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Plot graphs of imputed DataFrames and the complete case
diabetes_cc['___'].___(___='___', c='red', linewidth=3)
diabetes_mean_imputed['___'].plot(___='___')
diabetes_knn_imputed['___'].plot(___='___')
diabetes_mice_imputed['___'].plot(___='___')
# Create labels for the four DataFrames
labels = ['Baseline (Complete Case)', 'Mean Imputation', 'KNN Imputation', 'MICE Imputation']
plt.legend(___)
# Set the x-label as Skin Fold
plt.xlabel('___')
plt.show()