พยากรณ์จำนวนการเช่าจักรยานด้วยโมเดล Random Forest
ในแบบฝึกหัดนี้ จะใช้โมเดลที่ฝึกไว้ในแบบฝึกหัดก่อนหน้าเพื่อพยากรณ์จำนวนการเช่าจักรยานในเดือนสิงหาคม
ฟังก์ชัน predict() (docs) สำหรับโมเดล ranger จะคืนค่าเป็น list โดยหนึ่งในองค์ประกอบของ list นั้นคือ predictions ซึ่งเป็นเวกเตอร์ของค่าพยากรณ์ สามารถเข้าถึง predictions ได้ด้วยสัญลักษณ์ $ สำหรับการเข้าถึงองค์ประกอบที่มีชื่อใน list:
predict(model, data)$predictions
โมเดล bike_model_rf และชุดข้อมูล bikesAugust (สำหรับการประเมินผล) ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Supervised Learning ใน R: การถดถอย
คำแนะนำการฝึกหัด
- เรียกใช้
predict()กับbikesAugustเพื่อพยากรณ์จำนวนการเช่าจักรยานในเดือนสิงหาคม (cnt) แล้วเพิ่มค่าพยากรณ์ลงในbikesAugustเป็นคอลัมน์pred - เติมช่องว่างเพื่อคำนวณ root mean squared error ของค่าพยากรณ์
- โมเดล Poisson ที่สร้างสำหรับข้อมูลชุดนี้ให้ค่า RMSE ประมาณ 112.6 โมเดลนี้ดีกว่าหรือไม่?
- เติมช่องว่างเพื่อพล็อตกราฟแสดงจำนวนการเช่าจักรยานจริง (
cnt) เทียบกับค่าพยากรณ์ (predบนแกน x)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# bikesAugust is available
str(bikesAugust)
# bike_model_rf is available
bike_model_rf
# Make predictions on the August data
bikesAugust$pred <- ___(___, ___)$___
# Calculate the RMSE of the predictions
bikesAugust %>%
mutate(residual = ___) %>% # calculate the residual
summarize(rmse = ___) # calculate rmse
# Plot actual outcome vs predictions (predictions on x-axis)
ggplot(bikesAugust, aes(x = ___, y = ___)) +
geom_point() +
geom_abline()