Random Forest: dự đoán
Giờ bạn cần tạo một số dự đoán với mô hình random forest của mình. Cú pháp giống hệt như với mô hình gradient boosted trees.
Bài tập này là một phần của khóa học
Nhập môn Spark với sparklyr trong R
Hướng dẫn bài tập
Một kết nối Spark đã được tạo sẵn cho bạn là spark_conn. Các tibble gắn với bộ dữ liệu huấn luyện và kiểm thử được lưu trên Spark đã được định nghĩa trước lần lượt là track_data_to_model_tbl và track_data_to_predict_tbl. Mô hình random forest đã được định nghĩa trước là random_forest_model.
- Định nghĩa biến
predictedchứa các dự đoán của mô hình cho dữ liệu kiểm thử.- Gọi
ml_predict()với mô hình và dữ liệu kiểm thử làm đối số. Hàm này sẽ tạo dự đoán cho tập kiểm thử và thêm chúng dưới dạng một cột mới tênprediction.
- Gọi
- Định nghĩa biến
responsesđể chuẩn bị dữ liệu so sánh phản hồi dự đoán với phản hồi thực tế:- Chọn cột phản hồi
year. - Thu kết quả bằng
collect(). - Dùng
mutate()để thêm các dự đoán đã tạo trongpredicted.
- Chọn cột phản hồi
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___