CommencerCommencez gratuitement

Pandafy, un Spark DataFrame

Supposons que vous ayez exécuté une requête sur votre vaste ensemble de données et que vous l'ayez agrégée pour obtenir quelque chose de plus facile à gérer.

Il est parfois judicieux de récupérer cette table et de la manipuler localement à l'aide d'un outil tel que pandas. Les Spark DataFrames facilitent cette opération grâce à la méthode .toPandas(). L'appel de cette méthode sur un Spark DataFrame renvoie le DataFrame correspondant pandas. C'est aussi simple que cela.

Cette fois-ci, la requête compte le nombre de vols à destination de chaque aéroport depuis SEA et PDX.

Veuillez noter qu'il existe déjà un SparkSession intitulé spark dans votre espace de travail.

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Veuillez exécuter la requête en utilisant la méthode .sql(). Veuillez enregistrer le résultat dans le fichier flight_counts.
  • Veuillez utiliser la méthode .toPandas() sur flight_counts pour créer un DataFrame pandas nommé pd_counts.
  • Affichez .head() de pd_counts sur la console.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Modifier et exécuter le code