Redukcja danych z wykorzystaniem ważności cech
Mając gotowy pełny model lasu losowego, możesz teraz zbadać ważność cech.
Chociaż lasy losowe naturalnie – choć niejawnie – dokonują selekcji cech, budowanie zredukowanego modelu często przynosi dodatkowe korzyści. Zredukowany model trenuje się szybciej, generuje prognozy w krótszym czasie i jest łatwiejszy do zrozumienia oraz zarządzania. Oczywiście to zawsze kompromis między prostotą modelu a jego wydajnością.
W tym ćwiczeniu zredugujesz zbiór danych. W kolejnym ćwiczeniu dopasujemy zredukowany model i porównamy jego wydajność z modelem pełnym. Zmienne rf_fit, train i test są już dla ciebie dostępne.
Pakiety tidyverse, tidymodels i vip zostały wczytane.
To ćwiczenie jest częścią kursu
Redukcja wymiarowości w R
Instrukcje do ćwiczenia
- Użyj funkcji
vi()z parametremrank, aby wyodrębnić dziesięć najważniejszych cech. - Dodaj zmienną docelową z powrotem do listy najważniejszych cech.
- Zastosuj maskę najważniejszych cech, aby zredukować zbiory danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Extract the top ten features
top_features <- ___ %>%
___(___ = ___) %>%
filter(___) %>%
pull(Variable)
# Add the target variable to the feature list
top_features <- c(___, "___")
# Reduce and print the data sets
train_reduced <- train[___]
test_reduced <- ___[___]
train_reduced %>% head(5)
test_reduced %>% head(5)