CommencerCommencez gratuitement

Encoder l'origine du vol

La colonne org dans les données de vols est une variable catégorielle qui indique l'aéroport de départ.

  • ORD — O'Hare International Airport (Chicago)
  • SFO — San Francisco International Airport
  • JFK — John F Kennedy International Airport (New York)
  • LGA — La Guardia Airport (New York)
  • SMF — Sacramento
  • SJC — San Jose
  • OGG — Kahului (Hawaï)

Cela ne représente évidemment qu'un petit sous-ensemble d'aéroports. Néanmoins, comme il s'agit d'une variable catégorielle, elle doit être encodée en one-hot avant de pouvoir être utilisée dans un modèle de régression.

Les données sont dans une variable appelée flights. Vous avez déjà utilisé un indexeur de chaînes pour créer une colonne de valeurs indexées correspondant aux chaînes de org.

Il peut être utile de revoir les diaporamas des leçons dans le panneau Slides à côté de l'IPython Shell.

Cet exercice fait partie du cours

<cours>Apprentissage automatique avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Importez la classe de one-hot encoding.
  • Créez une instance du one-hot encoder, en nommant la colonne d'entrée org_idx et la colonne de sortie org_dummy.
  • Appliquez le one-hot encoder aux données de vols.
  • Générez un résumé de la correspondance entre les valeurs catégorielles et les variables indicatrices binaires. N'incluez que les valeurs uniques et ordonnez par org_idx.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the one hot encoder class
from pyspark.ml.____ import ____

# Create an instance of the one hot encoder
onehot = ____(inputCols=[____], outputCols=[____])

# Apply the one hot encoder to the flights data
onehot = onehot.____(____)
flights_onehot = onehot.____(____)

# Check the results
flights_onehot.____('org', 'org_idx', 'org_dummy').____().____('org_idx').show()
Modifier et exécuter le code