เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Random Forest: การทำนาย

ตอนนี้ถึงเวลาทำนายผลด้วยโมเดล random forest แล้ว ซึ่ง syntax จะเหมือนกับที่ใช้กับโมเดล gradient boosted trees ทุกประการ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

แนะนำ Spark ด้วย sparklyr ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

การเชื่อมต่อ Spark ได้ถูกสร้างไว้ให้แล้วในชื่อ spark_conn โดย Tibble ที่เชื่อมต่อกับชุดข้อมูลสำหรับ training และ testing ที่เก็บอยู่ใน Spark ได้ถูกกำหนดไว้ล่วงหน้าในชื่อ track_data_to_model_tbl และ track_data_to_predict_tbl ตามลำดับ และโมเดล random forest ได้ถูกกำหนดไว้ล่วงหน้าในชื่อ random_forest_model

  • กำหนดตัวแปร predicted ให้เก็บผลการทำนายของโมเดลสำหรับข้อมูล testing
    • เรียกใช้ ml_predict() โดยส่งโมเดลและข้อมูล testing เป็นอาร์กิวเมนต์ ฟังก์ชันนี้จะสร้างผลการทำนายสำหรับชุดข้อมูล testing และเพิ่มผลลัพธ์เป็นคอลัมน์ใหม่ชื่อ prediction
  • กำหนดตัวแปร responses เพื่อเตรียมข้อมูลสำหรับเปรียบเทียบผลที่ทำนายกับผลจริง:
    • เลือกคอลัมน์ผลลัพธ์ year
    • รวบรวมผลลัพธ์ด้วย collect
    • ใช้ mutate() เพื่อเพิ่มผลการทำนายจาก predicted เข้าไป

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model

# Predict the responses for the testing data
predicted <- ml_predict(
      ___,
      ___) %>% pull(prediction)

# Create a response vs. actual dataset
responses <- ___
แก้ไขและรันโค้ด