Random Forest: prediksi
Sekarang Anda perlu membuat beberapa prediksi dengan model random forest Anda. Sintaksnya sama seperti pada model gradient boosted trees.
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Tibble yang terhubung ke himpunan data pelatihan dan pengujian yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_data_to_model_tbl dan track_data_to_predict_tbl. Model random forest telah didefinisikan sebelumnya sebagai random_forest_model.
- Definisikan variabel
predictedyang berisi prediksi model untuk data pengujian kita.- Panggil
ml_predict()dengan model dan data pengujian sebagai argumen. Fungsi ini akan menghasilkan prediksi untuk himpunan data pengujian dan menambahkannya sebagai kolom baru bernamaprediction.
- Panggil
- Definisikan variabel
responsesuntuk menyiapkan data dalam membandingkan respons terprediksi dengan respons aktual:- Pilih kolom respons
year. - Kumpulkan hasilnya.
- Gunakan
mutate()untuk menambahkan prediksi yang dibuat dipredicted.
- Pilih kolom respons
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___