วิเคราะห์สรุปผลของโมเดลเชิงเส้น
การวิเคราะห์ประสิทธิภาพของโมเดลที่ใช้ข้อมูล impute แบบต่างๆ ถือเป็นหนึ่งในงานที่สำคัญที่สุดในการจัดการกับข้อมูลที่ขาดหาย เพราะช่วยกำหนดได้ว่า DataFrame ที่ผ่านการ impute แบบใดน่าเชื่อถือที่สุด สำหรับการวิเคราะห์นี้ สามารถ fit โมเดล linear regression บน DataFrame ที่ผ่านการ impute แล้วตรวจสอบพารามิเตอร์ต่างๆ ที่ส่งผลต่อการเลือกประเภทของการ impute
ในแบบฝึกหัดนี้ มีการโหลด DataFrame diabetes_cc ซึ่งเป็น complete case ของ DataFrame ข้อมูลโรคเบาหวานไว้ให้แล้ว โดย complete case นี้จะทำหน้าที่เป็นฐานสำหรับเปรียบเทียบกับ DataFrame ที่ผ่านการ impute แบบอื่นๆ คุณจะใช้แพ็กเกจ statsmodels.api ที่โหลดในชื่อ sm เพื่อสร้างโมเดล linear regression และสร้างสรุปผล
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลที่หายไปใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Add constant to X and set X & y values to fit linear model
X = sm.add_constant(___)
y = ___
lm = sm.OLS(y, X).fit()