Размерность и информативность признаков
Представьте, что вы работаете в банке и собрали данные о различных кредитах, выданных клиентам. Ваш руководитель хочет изучить возможность использования этих данных для классификации клиентов по кредитным категориям. Выборка доступных данных загружена в credit_df. Вам нужно определить, сколько признаков содержат данные, а также выявить признаки, которые не помогут при классификации клиентов.
Пакет tidyverse уже загружен.
Это упражнение является частью курса
Снижение размерности в R
Инструкции к упражнению
- Найдите количество признаков в
credit_df. - Вычислите дисперсию каждого признака в
credit_df. - Определите признак с нулевой дисперсией и присвойте его
column_to_remove.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Find the number of features
___ %>% ___()
# Compute each column variance
credit_df %>%
___(___(___(), ~ ___(., na.rm = TRUE))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "variance")
# Assign the zero-variance column
column_to_remove <- "___"