PCA w tidymodels
Z perspektywy budowania modeli PCA pozwala tworzyć modele z mniejszą liczbą cech, zachowując przy tym większość informacji zawartych w oryginalnych danych. Jak już wiesz, wadą PCA jest trudność w interpretacji modelu. W tym ćwiczeniu skupisz się na budowie modelu regresji liniowej na podstawie podzbioru danych dotyczących sprzedaży domów. Zmienną docelową jest price.
Model zbudowany bezpośrednio na danych, bez ekstrakcji głównych składowych, osiąga RMSE równe 236 461,4 USD. Zastosujesz PCA z użyciem pakietu tidymodels i porównasz nową wartość RMSE. Pamiętaj – im niższe RMSE, tym lepiej.
Pakiety tidyverse i tidymodels zostały już wczytane.
To ćwiczenie jest częścią kursu
Redukcja wymiarowości w R
Instrukcje do ćwiczenia
- Zbuduj przepis PCA na podstawie
train, wyodrębniając pięć głównych składowych. - Dopasuj przepływ pracy z domyślną specyfikacją modelu
linear_reg(). - Utwórz ramkę danych z prognozami testowymi na podstawie
test, zawierającą rzeczywiste i przewidywane wartości. - Oblicz RMSE dla modelu regresji liniowej zredukowanego za pomocą PCA.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build a PCA recipe
pca_recipe <- ___(___ ~ ___ , data = ___) %>%
___(___()) %>%
___(___(), num_comp = ___)
# Fit a workflow with a default linear_reg() model spec
house_sales_fit <- ___(preprocessor = ___, spec = ___()) %>%
___(___)
# Create prediction df for the test set
house_sales_pred_df <- ___(___, test) %>%
___(test %>% select(___))
# Calculate the RMSE
___(house_sales_pred_df, ___, .pred)