เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

แสดงภาพผลการ Impute

การวิเคราะห์และเลือกวิธี Imputation ที่ดีที่สุดเป็นงานที่ต้องอาศัยการทดลองหลายครั้ง สิ่งสำคัญคือต้องแน่ใจว่าข้อมูลไม่เกิดความเอนเอียงระหว่างกระบวนการ Imputation ในสองแบบฝึกหัดที่ผ่านมา คุณได้สร้าง Imputation 4 แบบโดยใช้ค่าเฉลี่ย (mean), มัธยฐาน (median), ฐานนิยม (mode) และการเติมด้วยค่าคงที่ (constant)

ในแบบฝึกหัดนี้ จะสร้าง Scatterplot ของ DataFrame ที่ Impute ไปแล้ว โดยสร้าง Dictionary ของ DataFrame โดยใช้ชื่อเป็นคีย์

โหลด DataFrame diabetes_mean, diabetes_median, diabetes_mode และ diabetes_constant ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การจัดการข้อมูลที่หายไปใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง Subplot 4 ช่อง โดยจัดเป็น 2 แถวและ 2 คอลัมน์
  • สร้าง Dictionary imputations โดยจับคู่แต่ละคีย์กับ DataFrame ที่ตรงกัน
  • ลูปผ่าน axes และ imputations แล้วพล็อตแต่ละ DataFrame ใน imputations
  • กำหนดสีตามค่า nullity และตั้งชื่อ Subplot แต่ละช่องตามชื่อวิธี Imputation

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
แก้ไขและรันโค้ด