Jointures, partie 2
Dans PySpark, les jointures sont effectuées à l'aide de la méthode .join() DataFrame. Cette méthode nécessite trois arguments. Le premier est le deuxième DataFrame que vous souhaitez joindre au premier. Le deuxième argument, on, correspond au nom de la ou des colonnes clés sous forme de chaîne. Les noms des colonnes clés doivent être identiques dans chaque table. Le troisième argument, how, spécifie le type de jointure à effectuer. Dans ce cours, nous utiliserons systématiquement la valeur how="leftouter".
L'ensemble de données flights et un nouvel ensemble de données appelé airports sont déjà disponibles dans votre espace de travail.
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
Veuillez examiner le DataFrame
airportsen appelant.show(). Veuillez noter quelle colonne clé vous permettra de joindre la tableairportsà la tableflights.Renommez la colonne
faadansairportsendest, en réaffectant le résultat deairports.withColumnRenamed("faa", "dest")dansairports.Veuillez joindre
flightsavec le DataFrameairportssur la colonnedesten appelant la méthode.join()surflights. Enregistrez le résultat sousflights_with_airports.Le premier argument devrait être l'autre DataFrame,
airports.L'argument
ondevrait être la colonne clé.L’argument
howdoit être égal à"leftouter".
Veuillez contacter
.show()surflights_with_airportspour réexaminer les données. Veuillez noter les nouvelles informations qui ont été ajoutées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)