Codificarea aeroportului de origine
Coloana org din setul de date despre zboruri este o variabilă categorică care indică aeroportul de plecare al unui zbor.
- ORD — Aeroportul Internațional O'Hare (Chicago)
- SFO — Aeroportul Internațional San Francisco
- JFK — Aeroportul Internațional John F. Kennedy (New York)
- LGA — Aeroportul La Guardia (New York)
- SMF — Sacramento
- SJC — San Jose
- OGG — Kahului (Hawaii)
Acesta este, evident, doar un subset restrâns de aeroporturi. Totuși, deoarece este o variabilă categorică, trebuie codificată one-hot înainte de a putea fi utilizată într-un model de regresie.
Datele se află într-o variabilă numită flights. Ai folosit deja un indexor de șiruri pentru a crea o coloană cu valorile indexate corespunzătoare șirurilor din org.
Poate fi util să revezi slide-urile din lecții în panoul Slide-uri, aflat lângă IPython Shell.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Importă clasa pentru codificarea one-hot.
- Creează o instanță a codificatorului one-hot, specificând coloana de intrare
org_idxși coloana de ieșireorg_dummy. - Aplică codificatorul one-hot pe datele despre zboruri.
- Generează un sumar al mapării de la valorile categorice la variabilele dummy codificate binar. Include doar valorile unice și ordonează după
org_idx.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the one hot encoder class
from pyspark.ml.____ import ____
# Create an instance of the one hot encoder
onehot = ____(inputCols=[____], outputCols=[____])
# Apply the one hot encoder to the flights data
onehot = onehot.____(____)
flights_onehot = onehot.____(____)
# Check the results
flights_onehot.____('org', 'org_idx', 'org_dummy').____().____('org_idx').show()