Выбор значимых признаков
В этом упражнении вы определите избыточные столбцы в наборе данных volunteer и выполните отбор признаков, чтобы получить DataFrame с только значимыми из них.
Например, если вы изучите набор данных volunteer в консоли, то заметите три признака, связанных с местоположением: locality, region и postalcode. Они содержат схожую информацию, поэтому имеет смысл оставить лишь один из них.
Потратьте немного времени на изучение признаков набора данных volunteer в консоли и постарайтесь определить избыточные из них.
Это упражнение является частью курса
Предобработка данных для машинного обучения на Python
Инструкции к упражнению
- Создайте список избыточных столбцов и сохраните его в переменную
to_drop:- Из всех признаков, связанных с местоположением, оставьте только
postalcode. - Признаки, прошедшие через процесс конструирования признаков, также являются избыточными.
- Из всех признаков, связанных с местоположением, оставьте только
- Удалите столбцы из списка
to_dropиз набора данных. - Выведите
.head()переменнойvolunteer_subset, чтобы просмотреть отобранные столбцы.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)