One-hot кодування вибраних стовпців
Місцевий автосалон уживаних авто просить вас допомогти спрогнозувати ціну продажу своїх транспортних засобів. Якщо застосувати one-hot кодування до всього набору даних used_cars, новий набір міститиме понад 1 200 стовпців. Ви непокоїтеся, що це може спричинити проблеми під час тренування моделей машинного навчання для прогнозування ціни. Ви вирішили спробувати простіший підхід і застосувати one-hot кодування лише до кількох стовпців.
Ця вправа є частиною курсу
Робота з категоріальними даними в Python
Інструкції до вправи
- Створіть новий набір даних
used_cars_simpleіз one-hot кодуванням для таких стовпців:"manufacturer_name"та"transmission"(у такому порядку). - Задайте префікс для всіх нових стовпців
"dummy", щоб ви могли легко відфільтрувати щойно створені стовпці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
used_cars,
# Specify the columns from the instructions
____,
# Set the prefix
____
)
# Print the shape of the new dataset
print(used_cars_simple.shape)