Kom igångKom igång gratis

Variabelviktighet

Du vet redan att baggade träd är en ensemblemodell som löser variansproblemet hos beslutsträd. Nu har du också lärt dig att random forest-algoritmen förbättrar detta ytterligare genom att använda ett slumpmässigt urval av särdrag i varje träd. Det minskar korrelationen inom ensemblen och förbättrar dess prediktiva förmåga.

I den här övningen bygger du en random forest och plottar prediktorernas viktighet med hjälp av paketet vip. Träningsdatan, customers_train, är förladdad i din arbetsmiljö.

Den här övningen är en del av kursen

Maskininlärning med trädbaserade modeller i R

Visa kurs

Övningsinstruktioner

  • Skapa spec, specifikationen för en random forest-klassificeringsmodell med motorn "ranger" och variabelviktighet av typen "impurity".
  • Skapa model genom att anpassa tibble:n customers_train till spec, med still_customer som utfallsvariabel och alla övriga kolumner som prediktorer.
  • Plotta variabelviktigheten med funktionen vip() från paketet vip (som inte är förladdat).

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Specify a random forest
spec <- ___ %>%
	set_mode("classification") %>%
    set_engine(___, importance = ___)

# Train the forest
model <- spec %>%
    fit(___,
        ___)

# Plot the variable importance
vip::___(model)
Redigera och kör kod