ПочатиПочніть безкоштовно

Кодування аеропорту вильоту

Стовпець org у даних про рейси — це категоріальна змінна, що вказує аеропорт, з якого вилітає рейс.

  • ORD — міжнародний аеропорт О'Гара (Чикаго)
  • SFO — міжнародний аеропорт Сан-Франциско
  • JFK — міжнародний аеропорт імені Джона Ф. Кеннеді (Нью-Йорк)
  • LGA — аеропорт Ла-Гардик (Нью-Йорк)
  • SMF — Сакраменто
  • SJC — Сан-Хосе
  • OGG — Кахулуі (Гаваї)

Звісно, це лише невелика частина аеропортів. Проте, оскільки це категоріальна змінна, її потрібно перетворити методом one-hot encoding, перш ніж використовувати в регресійній моделі.

Дані містяться у змінній flights. Ви вже використали індексатор рядків, щоб створити стовпець з індексованими значеннями, що відповідають рядкам у org.

Може бути корисно переглянути слайди з уроків у панелі Slides поруч із IPython Shell.

Ця вправа є частиною курсу

Machine Learning з PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте клас one-hot encoder.
  • Створіть екземпляр one-hot encoder, вказавши вхідний стовпець org_idx, а вихідний — org_dummy.
  • Застосуйте one-hot encoder до даних flights.
  • Згенеруйте підсумок відображення з категоріальних значень у бінарно закодовані фіктивні змінні. Включіть лише унікальні значення та відсортуйте за org_idx.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the one hot encoder class
from pyspark.ml.____ import ____

# Create an instance of the one hot encoder
onehot = ____(inputCols=[____], outputCols=[____])

# Apply the one hot encoder to the flights data
onehot = onehot.____(____)
flights_onehot = onehot.____(____)

# Check the results
flights_onehot.____('org', 'org_idx', 'org_dummy').____().____('org_idx').show()
Редагувати та запускати код