Вибір релевантних ознак
У цій вправі ви визначите надлишкові стовпці в наборі даних volunteer і виконаєте відбір ознак, щоб отримати DataFrame лише з релевантними ознаками.
Наприклад, якщо ви дослідите набір даних volunteer у консолі, побачите три ознаки, пов'язані з місцем розташування: locality, region і postalcode. Вони містять споріднену інформацію, тож логічно залишити лише одну з них.
Приділіть трохи часу, щоб переглянути ознаки volunteer у консолі, і спробуйте визначити надлишкові ознаки.
Ця вправа є частиною курсу
Передобробка для машинного навчання в Python
Інструкції до вправи
- Створіть список назв надлишкових стовпців і збережіть його у змінній
to_drop:- Із усіх ознак, пов'язаних із місцем розташування, залиште лише
postalcode. - Ознаки, що пройшли інженерію ознак, також є надлишковими.
- Із усіх ознак, пов'язаних із місцем розташування, залиште лише
- Вилучіть зі «стисненого» набору даних стовпці зі списку
to_drop. - Виведіть
.head()датафреймуvolunteer_subset, щоб побачити вибрані стовпці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)