ПочатиПочніть безкоштовно

One-hot кодування вибраних стовпців

Місцевий автосалон уживаних авто просить вас допомогти спрогнозувати ціну продажу своїх транспортних засобів. Якщо застосувати one-hot кодування до всього набору даних used_cars, новий набір міститиме понад 1 200 стовпців. Ви непокоїтеся, що це може спричинити проблеми під час тренування моделей машинного навчання для прогнозування ціни. Ви вирішили спробувати простіший підхід і застосувати one-hot кодування лише до кількох стовпців.

Ця вправа є частиною курсу

Робота з категоріальними даними в Python

Переглянути курс

Інструкції до вправи

  • Створіть новий набір даних used_cars_simple із one-hot кодуванням для таких стовпців: "manufacturer_name" та "transmission" (у такому порядку).
  • Задайте префікс для всіх нових стовпців "dummy", щоб ви могли легко відфільтрувати щойно створені стовпці.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
  used_cars,
  # Specify the columns from the instructions
  ____,
  # Set the prefix
  ____
)

# Print the shape of the new dataset
print(used_cars_simple.shape)
Редагувати та запускати код