แสดงภาพผลการ Impute
การวิเคราะห์และเลือกวิธี Imputation ที่ดีที่สุดเป็นงานที่ต้องอาศัยการทดลองหลายครั้ง สิ่งสำคัญคือต้องแน่ใจว่าข้อมูลไม่เกิดความเอนเอียงระหว่างกระบวนการ Imputation ในสองแบบฝึกหัดที่ผ่านมา คุณได้สร้าง Imputation 4 แบบโดยใช้ค่าเฉลี่ย (mean), มัธยฐาน (median), ฐานนิยม (mode) และการเติมด้วยค่าคงที่ (constant)
ในแบบฝึกหัดนี้ จะสร้าง Scatterplot ของ DataFrame ที่ Impute ไปแล้ว โดยสร้าง Dictionary ของ DataFrame โดยใช้ชื่อเป็นคีย์
โหลด DataFrame diabetes_mean, diabetes_median, diabetes_mode และ diabetes_constant ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลที่หายไปใน Python
คำแนะนำการฝึกหัด
- สร้าง Subplot 4 ช่อง โดยจัดเป็น 2 แถวและ 2 คอลัมน์
- สร้าง Dictionary
imputationsโดยจับคู่แต่ละคีย์กับ DataFrame ที่ตรงกัน - ลูปผ่าน
axesและimputationsแล้วพล็อตแต่ละ DataFrame ในimputations - กำหนดสีตามค่า
nullityและตั้งชื่อ Subplot แต่ละช่องตามชื่อวิธี Imputation
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()