ÎncepețiÎncepe gratuit

Importanța variabilelor

Știi deja că arborii agregați (bagged trees) sunt un model de ansamblu care depășește problema varianței specifică arborilor de decizie. Ai aflat acum că algoritmul random forest îmbunătățește și mai mult acest lucru, folosind în fiecare arbore doar un subset aleatoriu de caracteristici. Astfel, se reduce și mai mult corelația dintre arborii din ansamblu, ceea ce îmbunătățește performanța predictivă.

În acest exercițiu, vei construi un random forest și vei reprezenta grafic importanța predictorilor folosind pachetul vip. Datele de antrenament, customers_train, sunt preîncărcate în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Machine Learning cu modele bazate pe arbori în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează spec, specificația unui model de clasificare random forest folosind motorul "ranger" și importanța variabilelor de tip "impurity".
  • Creează model antrenând tibble-ul customers_train pe spec, cu still_customer ca variabilă de rezultat și toate celelalte coloane ca variabile predictor.
  • Reprezintă grafic importanța variabilelor folosind funcția vip() din pachetul vip (care nu este preîncărcat).

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Specify a random forest
spec <- ___ %>%
	set_mode("classification") %>%
    set_engine(___, importance = ___)

# Train the forest
model <- spec %>%
    fit(___,
        ___)

# Plot the variable importance
vip::___(model)
Editează și rulează codul