CommencezCommencez gratuitement

Convertir un DataFrame Spark en pandas

Supposons que vous avez exécuté une requête sur votre très grand jeu de données et que vous l'avez agrégé pour en faire quelque chose de plus gérable.

Il est parfois pertinent de prendre ensuite cette table et de travailler localement avec un outil comme pandas. Les DataFrames Spark facilitent cela grâce à la méthode .toPandas(). Appeler cette méthode sur un DataFrame Spark retourne le DataFrame équivalent de pandas. Rien de plus simple !

Cette fois, la requête compte le nombre de vols vers chaque aéroport à partir de SEA et PDX.

Rappelez-vous qu'une SparkSession nommée spark est déjà disponible dans votre espace de travail !

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Exécutez la requête avec la méthode .sql(). Enregistrez le résultat dans flight_counts.
  • Utilisez la méthode .toPandas() sur flight_counts pour créer un DataFrame pandas nommé pd_counts.
  • Affichez le .head() de pd_counts dans la console.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Modifier et exécuter le code