Důležitost proměnných
Už víš, že bagged trees jsou ensemblový model, který překonává problém vysoké variance u rozhodovacích stromů. Teď ses navíc naučil/a, že algoritmus náhodného lesa to ještě vylepšuje tím, že v každém stromě používá jen náhodnou podmnožinu příznaků. To ensemble dále dekoreluje a zlepšuje jeho prediktivní výkon.
V tomto cvičení si sám/sama sestavíš náhodný les a zobrazíš důležitost prediktorů pomocí balíčku vip. Trénovací data customers_train jsou předem načtena v tvém pracovním prostředí.
Toto cvičení je součástí kurzu
Machine Learning with Tree-Based Models in R
Pokyny k cvičení
- Vytvoř
spec— specifikaci klasifikačního modelu náhodného lesa s využitím enginu"ranger"a důležitostí proměnných"impurity". - Vytvoř
modelnafitováním tibblecustomers_trainnaspec, přičemž jako výstupní proměnnou použijstill_customera všechny ostatní sloupce jako prediktory. - Zobraz důležitost proměnných pomocí funkce
vip()z balíčkuvip(který není předem načtený).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)