Odkrywanie skorelowanych predyktorów
Skorelowane zmienne predykcyjne dostarczają redundantnych informacji i mogą negatywnie wpływać na proces dopasowywania modelu. Gdy dwie zmienne są silnie skorelowane, ich wartości zmieniają się liniowo względem siebie – co oznacza, że przekazują algorytmom uczenia maszynowego te same informacje. Zjawisko to nosi nazwę wielokoliniowości.
Zanim rozpoczniesz dopasowywanie modelu, warto dokładnie przeanalizować zbiór danych, aby wykryć takie zależności i wyeliminować je na etapie inżynierii cech.
W tym ćwiczeniu zbadasz zbiór danych telecom_training, tworząc macierz korelacji dla wszystkich numerycznych zmiennych predykcyjnych.
Dane telecom_training zostały już wczytane do twojej sesji.
To ćwiczenie jest częścią kursu
Modelowanie z tidymodels w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
telecom_training %>%
# Select numeric columns
___(___) %>%
# Calculate correlation matrix
___