Variabelviktighet
Du vet redan att baggade träd är en ensemblemodell som löser variansproblemet hos beslutsträd. Nu har du också lärt dig att random forest-algoritmen förbättrar detta ytterligare genom att använda ett slumpmässigt urval av särdrag i varje träd. Det minskar korrelationen inom ensemblen och förbättrar dess prediktiva förmåga.
I den här övningen bygger du en random forest och plottar prediktorernas viktighet med hjälp av paketet vip. Träningsdatan, customers_train, är förladdad i din arbetsmiljö.
Den här övningen är en del av kursen
Maskininlärning med trädbaserade modeller i R
Övningsinstruktioner
- Skapa
spec, specifikationen för en random forest-klassificeringsmodell med motorn"ranger"och variabelviktighet av typen"impurity". - Skapa
modelgenom att anpassa tibble:ncustomers_traintillspec, medstill_customersom utfallsvariabel och alla övriga kolumner som prediktorer. - Plotta variabelviktigheten med funktionen
vip()från paketetvip(som inte är förladdat).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)