การเปรียบเทียบและเลือก adjusted R-squared ที่ดีที่สุด
ในการวิเคราะห์ DataFrame ที่ผ่านการ impute บนโมเดลเชิงเส้น ค่า adjusted R-squared (\(adj.R^2\)) คือตัวชี้วัดที่บ่งบอกว่าโมเดลใดพอดีกับข้อมูลมากที่สุด
ในแบบฝึกหัดนี้ จะเปรียบเทียบค่า \(adj.R^2\) ของ โมเดลเชิงเส้น (สำหรับแต่ละชุดข้อมูลที่ผ่านการ impute) ที่สร้างไว้ก่อนหน้า ได้แก่ lm_mean, lm_KNN และ lm_MICE ตามลำดับ
จะพิมพ์ผลลัพธ์อย่างเป็นระเบียบ (โดยสร้าง DataFrame) โดยดึงค่าแอตทริบิวต์ rsquared_adj ของแต่ละโมเดล จากนั้นเลือกโมเดลที่มีค่า \(adj.R^2\) สูงสุด
โมเดลดังกล่าวถูกโหลดให้แล้วในชื่อ lm_mean, lm_KNN และ lm_MICE
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลที่หายไปใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Store the Adj. R-squared scores of the linear models
rsquared_df = pd.DataFrame({'Mean Imputation': ___,
'KNN Imputation': ___,
'MICE Imputation': ___},
index=['Adj. R-squared'])
# Neatly print the Adj. R-squared scores in the console
print(rsquared_df)