CommencerCommencez gratuitement

Jointures, partie 2

Dans PySpark, les jointures sont effectuées à l'aide de la méthode .join() DataFrame. Cette méthode nécessite trois arguments. Le premier est le deuxième DataFrame que vous souhaitez joindre au premier. Le deuxième argument, on, correspond au nom de la ou des colonnes clés sous forme de chaîne. Les noms des colonnes clés doivent être identiques dans chaque table. Le troisième argument, how, spécifie le type de jointure à effectuer. Dans ce cours, nous utiliserons systématiquement la valeur how="leftouter".

L'ensemble de données flights et un nouvel ensemble de données appelé airports sont déjà disponibles dans votre espace de travail.

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Veuillez examiner le DataFrame airports en appelant .show(). Veuillez noter quelle colonne clé vous permettra de joindre la table airports à la table flights.

  • Renommez la colonne faa dans airports en dest, en réaffectant le résultat de airports.withColumnRenamed("faa", "dest") dans airports.

  • Veuillez joindre flights avec le DataFrame airports sur la colonne dest en appelant la méthode .join() sur flights. Enregistrez le résultat sous flights_with_airports.

    • Le premier argument devrait être l'autre DataFrame, airports.

    • L'argument on devrait être la colonne clé.

    • L’argument how doit être égal à "leftouter".

  • Veuillez contacter .show() sur flights_with_airports pour réexaminer les données. Veuillez noter les nouvelles informations qui ont été ajoutées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
Modifier et exécuter le code