Enkoda flygplatsers ursprung
Kolumnen org i flyg-datamängden är en kategorisk variabel som anger flygplatsen ett flyg avgår från.
- ORD — O'Hare International Airport (Chicago)
- SFO — San Francisco International Airport
- JFK — John F Kennedy International Airport (New York)
- LGA — La Guardia Airport (New York)
- SMF — Sacramento
- SJC — San Jose
- OGG — Kahului (Hawaii)
Detta är självklart bara ett litet urval av flygplatser. Eftersom det ändå är en kategorisk variabel måste den one-hot-enkodas innan den kan användas i en regressionsmodell.
Datan finns i en variabel kallad flights. Du har redan använt en strängindexerare för att skapa en kolumn med indexerade värden som motsvarar strängarna i org.
Det kan vara till hjälp att gå tillbaka till slides från lektionerna i panelen Slides bredvid IPython Shell.
Den här övningen är en del av kursen
Maskininlärning med PySpark
Övningsinstruktioner
- Importera klassen för one-hot-enkodning.
- Skapa en instans av one-hot-enkodaren och ange
org_idxsom indatakolumn ochorg_dummysom utdatakolumn. - Applicera one-hot-enkodaren på flyg-datamängden.
- Generera en sammanfattning av mappningen från kategoriska värden till binärt enkodade dummyvariabler. Inkludera endast unika värden och sortera efter
org_idx.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the one hot encoder class
from pyspark.ml.____ import ____
# Create an instance of the one hot encoder
onehot = ____(inputCols=[____], outputCols=[____])
# Apply the one hot encoder to the flights data
onehot = onehot.____(____)
flights_onehot = onehot.____(____)
# Check the results
flights_onehot.____('org', 'org_idx', 'org_dummy').____().____('org_idx').show()