Random Forest: pemodelan
Seperti gradient boosted trees, random forests adalah bentuk lain dari ensemble model. Artinya, metode ini menggunakan banyak model yang lebih sederhana (kembali berupa decision tree) dan menggabungkannya untuk membentuk satu model yang lebih baik. Alih-alih menjalankan model yang sama secara iteratif, random forests menjalankan banyak model terpisah secara paralel, masing-masing pada subset data yang dipilih secara acak, dengan subset fitur yang juga dipilih secara acak. Kemudian decision tree akhir membuat prediksi dengan mengagregasikan hasil dari model-model individual tersebut.
Fungsi random forest di sparklyr bernama ml_random_forest(). Cara penggunaannya persis sama dengan ml_gradient_boosted_trees() (lihat latihan pertama di bab ini untuk mengingat kembali sintaksnya).
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke gabungan dan hasil penyaringan metadata trek/data timbre yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_data_to_model_tbl.
- Ulangi analisis prediksi tahun Anda, kali ini menggunakan model random forest.
- Ambil kolom
timbredaritrack_data_to_model_tbldan simpan hasilnya kefeature_colnames. - Buat formula untuk model menggunakan
reformulate(). - Jalankan model random forest dan simpan hasilnya ke
random_forest_model.
- Ambil kolom
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___