Zacznij terazZacznij za darmo

Skorelowane zmienne

W tym ćwiczeniu przeanalizujesz zbiór danych pod kątem skorelowanych zmiennych. Przed zastosowaniem klasyfikatora binarnego ważne jest, aby je usunąć – szczególnie w przypadku regresji logistycznej. Jeśli dwie lub więcej zmiennych jest silnie skorelowanych, należy zachować tylko jedną z nich.

Na początek użyjemy funkcji corrplot() z pakietu corrplot, aby zwizualizować korelacje. Na wykresie korelacji kolor niebieski oznacza korelację dodatnią, a czerwony – ujemną. Ciemniejszy kolor wskazuje na silniejszą korelację. Na końcu usuniesz silnie skorelowane zmienne ze zbioru danych.

To ćwiczenie jest częścią kursu

Predykcyjna analityka sieciowa w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Remove the Future column from studentnetworkdata 
no_future <- ___

# Load the corrplot package
library(___)

# Generate the correlation matrix
M <- ___(no_future)

# Plot the correlations
___(M, method = "circle")
Edytuj i uruchom kod