Кодування аеропорту вильоту
Стовпець org у даних про рейси — це категоріальна змінна, що вказує аеропорт, з якого вилітає рейс.
- ORD — міжнародний аеропорт О'Гара (Чикаго)
- SFO — міжнародний аеропорт Сан-Франциско
- JFK — міжнародний аеропорт імені Джона Ф. Кеннеді (Нью-Йорк)
- LGA — аеропорт Ла-Гардик (Нью-Йорк)
- SMF — Сакраменто
- SJC — Сан-Хосе
- OGG — Кахулуі (Гаваї)
Звісно, це лише невелика частина аеропортів. Проте, оскільки це категоріальна змінна, її потрібно перетворити методом one-hot encoding, перш ніж використовувати в регресійній моделі.
Дані містяться у змінній flights. Ви вже використали індексатор рядків, щоб створити стовпець з індексованими значеннями, що відповідають рядкам у org.
Може бути корисно переглянути слайди з уроків у панелі Slides поруч із IPython Shell.
Ця вправа є частиною курсу
Machine Learning з PySpark
Інструкції до вправи
- Імпортуйте клас one-hot encoder.
- Створіть екземпляр one-hot encoder, вказавши вхідний стовпець
org_idx, а вихідний —org_dummy. - Застосуйте one-hot encoder до даних
flights. - Згенеруйте підсумок відображення з категоріальних значень у бінарно закодовані фіктивні змінні. Включіть лише унікальні значення та відсортуйте за
org_idx.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the one hot encoder class
from pyspark.ml.____ import ____
# Create an instance of the one hot encoder
onehot = ____(inputCols=[____], outputCols=[____])
# Apply the one hot encoder to the flights data
onehot = onehot.____(____)
flights_onehot = onehot.____(____)
# Check the results
flights_onehot.____('org', 'org_idx', 'org_dummy').____().____('org_idx').show()