เปรียบเทียบประสิทธิภาพของโมเดล
การพล็อตกราฟช่วยให้เห็นภาพได้ชัดว่าโมเดลทำงานได้ดีหรือไม่ดีในส่วนไหน แต่บางครั้งการมีค่าสถิติที่ให้คะแนนโมเดลออกมาตรงๆ ก็เป็นประโยชน์มากกว่า เพราะช่วยให้วัดความแม่นยำของโมเดลได้เป็นตัวเลข และนำไปเปรียบเทียบระหว่างโมเดลต่างๆ ได้ ค่าสถิติที่นิยมใช้กันคือ root mean square error (หรือที่เรียกย่อว่า "RMSE") ซึ่งคำนวณโดยยกกำลังสองของ residual แต่ละค่า แล้วหาค่าเฉลี่ย จากนั้นถอดรากที่สอง ค่า RMSE ที่น้อยแสดงว่าโมเดลทำนายได้แม่นยำกว่า (โดยค่าเริ่มต้น RMSE ใช้เปรียบเทียบระหว่างโมเดลบนชุดข้อมูลเดียวกันเท่านั้น ไม่สามารถเปรียบเทียบข้ามชุดข้อมูลที่ต่างกันได้โดยตรง เว้นแต่จะทำการ normalize ข้อมูลก่อน)
ในแบบฝึกหัดนี้ จะเปรียบเทียบโมเดล gradient boosted trees และ random forest
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
คำแนะนำการฝึกหัด
both_responses เป็น local tibble ที่กำหนดไว้ล่วงหน้าแล้ว ซึ่งเก็บค่าปีที่ทำนายและปีจริงของแต่ละแทร็กจากทั้งสองโมเดล
- สร้างชุดข้อมูล sum of squares of residuals
- เพิ่มคอลัมน์
residualโดยให้มีค่าเท่ากับค่าที่ทำนายได้ลบด้วยค่าจริง - จัดกลุ่มข้อมูลตาม
model - คำนวณค่าสถิติสรุป
rmseซึ่งมีค่าเท่ากับรากที่สองของค่าเฉลี่ยของresidualยกกำลังสอง
- เพิ่มคอลัมน์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# both_responses has been pre-defined
both_responses
# Create a residual sum of squares dataset
___