สร้างโมเดลที่ดีขึ้น
ก่อนหน้านี้ได้สร้างชุดโมเดลอย่างง่ายเพื่อพยากรณ์ อายุขัย โดยใช้ฟีเจอร์ year ซึ่งจากการวิเคราะห์พบว่าโมเดลบางตัวยังมีความพอดีที่ไม่ดีนัก
ในแบบฝึกหัดนี้ จะสร้างโมเดลถดถอยพหุคูณสำหรับแต่ละประเทศโดยใช้ฟีเจอร์ทั้งหมดที่มี เพื่อเปรียบเทียบประสิทธิภาพของ 4 โมเดลที่มีความพอดีต่ำที่สุด ค่า Adjusted \(R^2\) ของแต่ละประเทศแสดงไว้ด้านล่าง:
| ประเทศ | Adjusted \(R^2\) |
|---|---|
| Botswana | -0.0060772 |
| Lesotho | -0.0169851 |
| Zambia | 0.1668999 |
| Zimbabwe | 0.2083979 |
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ใน Tidyverse
คำแนะนำการฝึกหัด
- สร้างโมเดลเชิงเส้นสำหรับแต่ละประเทศเพื่อพยากรณ์
life_expectancyโดยใช้ฟีเจอร์ทุกตัวในชุดข้อมูล - เพิ่มคอลัมน์ (
fit) ที่บรรจุค่าสถิติความพอดีของแต่ละโมเดล และทำให้ data frame นี้กระชับขึ้น - แสดงค่า Adjusted \(R^2\) ใน
fullmodel_perfของ 4 ประเทศจาก data frameworst_fit
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Build a linear model for each country using all features
gap_fullmodel <- gap_nested %>%
mutate(model = map(data, ~lm(formula = ___, data = .x)))
fullmodel_perf <- gap_fullmodel %>%
# Extract the fit statistics of each model into data frames
mutate(fit = map(model, ~___(.x))) %>%
# Simplify the fit data frames for each model
unnest(___)
# View the performance for the four countries with the worst fitting four simple models you looked at before
fullmodel_perf %>%
___(country %in% worst_fit$country) %>%
select(country, adj.r.squared)