Importanța variabilelor
Știi deja că arborii agregați (bagged trees) sunt un model de ansamblu care depășește problema varianței specifică arborilor de decizie. Ai aflat acum că algoritmul random forest îmbunătățește și mai mult acest lucru, folosind în fiecare arbore doar un subset aleatoriu de caracteristici. Astfel, se reduce și mai mult corelația dintre arborii din ansamblu, ceea ce îmbunătățește performanța predictivă.
În acest exercițiu, vei construi un random forest și vei reprezenta grafic importanța predictorilor folosind pachetul vip. Datele de antrenament, customers_train, sunt preîncărcate în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Machine Learning cu modele bazate pe arbori în R
Instrucțiuni pentru exercițiu
- Creează
spec, specificația unui model de clasificare random forest folosind motorul"ranger"și importanța variabilelor de tip"impurity". - Creează
modelantrenând tibble-ulcustomers_trainpespec, custill_customerca variabilă de rezultat și toate celelalte coloane ca variabile predictor. - Reprezintă grafic importanța variabilelor folosind funcția
vip()din pachetulvip(care nu este preîncărcat).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)