Creează un model complet de pădure aleatorie
Modelele de tip pădure aleatorie realizează în mod natural selecția caracteristicilor, deoarece construiesc mulți subarbori din subseturi aleatoare ale acestora. O modalitate de a înțelege importanța caracteristicilor este să antrenezi un model și apoi să extragi aceste importanțe. Prin urmare, în acest exercițiu vei folosi datele Healthcare Job Attrition pentru a antrena un model de clasificare rand_forest(), din care poți extrage importanțele caracteristicilor. Pentru a face importanțele disponibile, asigură-te că creezi modelul cu importance = "impurity". Seturile train și test sunt disponibile.
Pachetele tidyverse, tidymodels și vip au fost deja încărcate.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în R
Instrucțiuni pentru exercițiu
- Definește un model de clasificare de tip pădure aleatorie cu 200 de arbori, din care să poți extrage importanțele caracteristicilor.
- Antrenează modelul de pădure aleatorie folosind toți predictorii.
- Atașează predicțiile la setul de testare.
- Calculează metrica F1.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>%
set_engine("___", ___ = "___")
# Fit the random forest model with all predictors
rf_fit <- ___ %>%
___(___, data = ___)
# Create the test set prediction data frame
predict_df <- ___ %>%
bind_cols(predict = ___(___, ___))
# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)