Zacznij terazZacznij za darmo

PCA w tidymodels

Z perspektywy budowania modeli PCA pozwala tworzyć modele z mniejszą liczbą cech, zachowując przy tym większość informacji zawartych w oryginalnych danych. Jak już wiesz, wadą PCA jest trudność w interpretacji modelu. W tym ćwiczeniu skupisz się na budowie modelu regresji liniowej na podstawie podzbioru danych dotyczących sprzedaży domów. Zmienną docelową jest price.

Model zbudowany bezpośrednio na danych, bez ekstrakcji głównych składowych, osiąga RMSE równe 236 461,4 USD. Zastosujesz PCA z użyciem pakietu tidymodels i porównasz nową wartość RMSE. Pamiętaj – im niższe RMSE, tym lepiej.

Pakiety tidyverse i tidymodels zostały już wczytane.

To ćwiczenie jest częścią kursu

Redukcja wymiarowości w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Zbuduj przepis PCA na podstawie train, wyodrębniając pięć głównych składowych.
  • Dopasuj przepływ pracy z domyślną specyfikacją modelu linear_reg().
  • Utwórz ramkę danych z prognozami testowymi na podstawie test, zawierającą rzeczywiste i przewidywane wartości.
  • Oblicz RMSE dla modelu regresji liniowej zredukowanego za pomocą PCA.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Build a PCA recipe
pca_recipe <- ___(___ ~ ___ , data = ___) %>% 
  ___(___()) %>% 
  ___(___(), num_comp = ___) 

# Fit a workflow with a default linear_reg() model spec
house_sales_fit <- ___(preprocessor = ___, spec = ___()) %>% 
  ___(___)

# Create prediction df for the test set
house_sales_pred_df <- ___(___, test) %>% 
  ___(test %>% select(___))

# Calculate the RMSE
___(house_sales_pred_df, ___, .pred)
Edytuj i uruchom kod