НачатьНачать бесплатно

Выбор значимых признаков

В этом упражнении вы определите избыточные столбцы в наборе данных volunteer и выполните отбор признаков, чтобы получить DataFrame с только значимыми из них.

Например, если вы изучите набор данных volunteer в консоли, то заметите три признака, связанных с местоположением: locality, region и postalcode. Они содержат схожую информацию, поэтому имеет смысл оставить лишь один из них.

Потратьте немного времени на изучение признаков набора данных volunteer в консоли и постарайтесь определить избыточные из них.

Это упражнение является частью курса

Предобработка данных для машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте список избыточных столбцов и сохраните его в переменную to_drop:
    • Из всех признаков, связанных с местоположением, оставьте только postalcode.
    • Признаки, прошедшие через процесс конструирования признаков, также являются избыточными.
  • Удалите столбцы из списка to_drop из набора данных.
  • Выведите .head() переменной volunteer_subset, чтобы просмотреть отобранные столбцы.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]

# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)

# Print out the head of volunteer_subset
print(____)
Редактировать и запускать код