Random Forest: การทำนาย
ตอนนี้ถึงเวลาทำนายผลด้วยโมเดล random forest แล้ว ซึ่ง syntax จะเหมือนกับที่ใช้กับโมเดล gradient boosted trees ทุกประการ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
แนะนำ Spark ด้วย sparklyr ใน R
คำแนะนำการฝึกหัด
การเชื่อมต่อ Spark ได้ถูกสร้างไว้ให้แล้วในชื่อ spark_conn โดย Tibble ที่เชื่อมต่อกับชุดข้อมูลสำหรับ training และ testing ที่เก็บอยู่ใน Spark ได้ถูกกำหนดไว้ล่วงหน้าในชื่อ track_data_to_model_tbl และ track_data_to_predict_tbl ตามลำดับ และโมเดล random forest ได้ถูกกำหนดไว้ล่วงหน้าในชื่อ random_forest_model
- กำหนดตัวแปร
predictedให้เก็บผลการทำนายของโมเดลสำหรับข้อมูล testing- เรียกใช้
ml_predict()โดยส่งโมเดลและข้อมูล testing เป็นอาร์กิวเมนต์ ฟังก์ชันนี้จะสร้างผลการทำนายสำหรับชุดข้อมูล testing และเพิ่มผลลัพธ์เป็นคอลัมน์ใหม่ชื่อprediction
- เรียกใช้
- กำหนดตัวแปร
responsesเพื่อเตรียมข้อมูลสำหรับเปรียบเทียบผลที่ทำนายกับผลจริง:- เลือกคอลัมน์ผลลัพธ์
year - รวบรวมผลลัพธ์ด้วย collect
- ใช้
mutate()เพื่อเพิ่มผลการทำนายจากpredictedเข้าไป
- เลือกคอลัมน์ผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___