Convertir un DataFrame Spark en pandas
Supposons que vous avez exécuté une requête sur votre très grand jeu de données et que vous l'avez agrégé pour en faire quelque chose de plus gérable.
Il est parfois pertinent de prendre ensuite cette table et de travailler localement avec un outil comme pandas. Les DataFrames Spark facilitent cela grâce à la méthode .toPandas(). Appeler cette méthode sur un DataFrame Spark retourne le DataFrame équivalent de pandas. Rien de plus simple !
Cette fois, la requête compte le nombre de vols vers chaque aéroport à partir de SEA et PDX.
Rappelez-vous qu'une SparkSession nommée spark est déjà disponible dans votre espace de travail !
Cette activité fait partie du cours
Fondements de PySpark
Instructions de l’exercice
- Exécutez la requête avec la méthode
.sql(). Enregistrez le résultat dansflight_counts. - Utilisez la méthode
.toPandas()surflight_countspour créer unDataFramepandasnommépd_counts. - Affichez le
.head()depd_countsdans la console.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)