Mulai sekarangMulai gratis

Random Forest: pemodelan

Seperti gradient boosted trees, random forests adalah bentuk lain dari ensemble model. Artinya, metode ini menggunakan banyak model yang lebih sederhana (kembali berupa decision tree) dan menggabungkannya untuk membentuk satu model yang lebih baik. Alih-alih menjalankan model yang sama secara iteratif, random forests menjalankan banyak model terpisah secara paralel, masing-masing pada subset data yang dipilih secara acak, dengan subset fitur yang juga dipilih secara acak. Kemudian decision tree akhir membuat prediksi dengan mengagregasikan hasil dari model-model individual tersebut.

Fungsi random forest di sparklyr bernama ml_random_forest(). Cara penggunaannya persis sama dengan ml_gradient_boosted_trees() (lihat latihan pertama di bab ini untuk mengingat kembali sintaksnya).

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke gabungan dan hasil penyaringan metadata trek/data timbre yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_data_to_model_tbl.

  • Ulangi analisis prediksi tahun Anda, kali ini menggunakan model random forest.
    • Ambil kolom timbre dari track_data_to_model_tbl dan simpan hasilnya ke feature_colnames.
    • Buat formula untuk model menggunakan reformulate().
    • Jalankan model random forest dan simpan hasilnya ke random_forest_model.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl

# Get the timbre columns
feature_colnames <- ___

# Create the formula for the model
year_formula <- ___

# Run the random forest model
random_forest_model <- ___
Edit dan Jalankan Kode