Zacznij terazZacznij za darmo

Redukcja danych z wykorzystaniem ważności cech

Mając gotowy pełny model lasu losowego, możesz teraz zbadać ważność cech.

Chociaż lasy losowe naturalnie – choć niejawnie – dokonują selekcji cech, budowanie zredukowanego modelu często przynosi dodatkowe korzyści. Zredukowany model trenuje się szybciej, generuje prognozy w krótszym czasie i jest łatwiejszy do zrozumienia oraz zarządzania. Oczywiście to zawsze kompromis między prostotą modelu a jego wydajnością.

W tym ćwiczeniu zredugujesz zbiór danych. W kolejnym ćwiczeniu dopasujemy zredukowany model i porównamy jego wydajność z modelem pełnym. Zmienne rf_fit, train i test są już dla ciebie dostępne.

Pakiety tidyverse, tidymodels i vip zostały wczytane.

To ćwiczenie jest częścią kursu

Redukcja wymiarowości w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj funkcji vi() z parametrem rank, aby wyodrębnić dziesięć najważniejszych cech.
  • Dodaj zmienną docelową z powrotem do listy najważniejszych cech.
  • Zastosuj maskę najważniejszych cech, aby zredukować zbiory danych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Extract the top ten features
top_features <- ___ %>% 
  ___(___ = ___) %>% 
  filter(___) %>% 
  pull(Variable)

# Add the target variable to the feature list
top_features <- c(___, "___")

# Reduce and print the data sets
train_reduced <- train[___]
test_reduced <- ___[___]
train_reduced %>% head(5)
test_reduced %>% head(5)
Edytuj i uruchom kod