НачатьНачать бесплатно

Размерность и информативность признаков

Представьте, что вы работаете в банке и собрали данные о различных кредитах, выданных клиентам. Ваш руководитель хочет изучить возможность использования этих данных для классификации клиентов по кредитным категориям. Выборка доступных данных загружена в credit_df. Вам нужно определить, сколько признаков содержат данные, а также выявить признаки, которые не помогут при классификации клиентов.

Пакет tidyverse уже загружен.

Это упражнение является частью курса

Снижение размерности в R

Посмотреть курс

Инструкции к упражнению

  • Найдите количество признаков в credit_df.
  • Вычислите дисперсию каждого признака в credit_df.
  • Определите признак с нулевой дисперсией и присвойте его column_to_remove.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Find the number of features
___ %>% ___()

# Compute each column variance
credit_df %>% 
  ___(___(___(), ~ ___(., na.rm = TRUE))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "variance")

# Assign the zero-variance column
column_to_remove <- "___"
Редактировать и запускать код