Корельовані змінні
У цій вправі ви проаналізуєте набір даних щодо корельованих змінних. Перед застосуванням бінарного класифікатора важливо їх вилучити, особливо у випадку логістичної регресії. Коли дві чи більше змінних мають високу кореляцію, слід залишити лише одну, а решту видалити.
Спершу ми використаємо функцію corrplot() з пакета corrplot, щоб візуалізувати кореляції.
На діаграмі кореляцій синій колір означає додатну кореляцію, а червоний — від'ємну.
Чим темніший колір, тим вища кореляція.
Насамкінець ви видалите з набору даних змінні з високою кореляцією.
Ця вправа є частиною курсу
Прогнозна аналітика з мережевими даними в R
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Remove the Future column from studentnetworkdata
no_future <- ___
# Load the corrplot package
library(___)
# Generate the correlation matrix
M <- ___(no_future)
# Plot the correlations
___(M, method = "circle")