Kom igångKom igång gratis

Enkoda flygplatsers ursprung

Kolumnen org i flyg-datamängden är en kategorisk variabel som anger flygplatsen ett flyg avgår från.

  • ORD — O'Hare International Airport (Chicago)
  • SFO — San Francisco International Airport
  • JFK — John F Kennedy International Airport (New York)
  • LGA — La Guardia Airport (New York)
  • SMF — Sacramento
  • SJC — San Jose
  • OGG — Kahului (Hawaii)

Detta är självklart bara ett litet urval av flygplatser. Eftersom det ändå är en kategorisk variabel måste den one-hot-enkodas innan den kan användas i en regressionsmodell.

Datan finns i en variabel kallad flights. Du har redan använt en strängindexerare för att skapa en kolumn med indexerade värden som motsvarar strängarna i org.

Det kan vara till hjälp att gå tillbaka till slides från lektionerna i panelen Slides bredvid IPython Shell.

Den här övningen är en del av kursen

Maskininlärning med PySpark

Visa kurs

Övningsinstruktioner

  • Importera klassen för one-hot-enkodning.
  • Skapa en instans av one-hot-enkodaren och ange org_idx som indatakolumn och org_dummy som utdatakolumn.
  • Applicera one-hot-enkodaren på flyg-datamängden.
  • Generera en sammanfattning av mappningen från kategoriska värden till binärt enkodade dummyvariabler. Inkludera endast unika värden och sortera efter org_idx.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the one hot encoder class
from pyspark.ml.____ import ____

# Create an instance of the one hot encoder
onehot = ____(inputCols=[____], outputCols=[____])

# Apply the one hot encoder to the flights data
onehot = onehot.____(____)
flights_onehot = onehot.____(____)

# Check the results
flights_onehot.____('org', 'org_idx', 'org_dummy').____().____('org_idx').show()
Redigera och kör kod