ПочатиПочніть безкоштовно

Корельовані змінні

У цій вправі ви проаналізуєте набір даних щодо корельованих змінних. Перед застосуванням бінарного класифікатора важливо їх вилучити, особливо у випадку логістичної регресії. Коли дві чи більше змінних мають високу кореляцію, слід залишити лише одну, а решту видалити.

Спершу ми використаємо функцію corrplot() з пакета corrplot, щоб візуалізувати кореляції. На діаграмі кореляцій синій колір означає додатну кореляцію, а червоний — від'ємну. Чим темніший колір, тим вища кореляція. Насамкінець ви видалите з набору даних змінні з високою кореляцією.

Ця вправа є частиною курсу

Прогнозна аналітика з мережевими даними в R

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Remove the Future column from studentnetworkdata 
no_future <- ___

# Load the corrplot package
library(___)

# Generate the correlation matrix
M <- ___(no_future)

# Plot the correlations
___(M, method = "circle")
Редагувати та запускати код