Pandafy, un Spark DataFrame
Supposons que vous ayez exécuté une requête sur votre vaste ensemble de données et que vous l'ayez agrégée pour obtenir quelque chose de plus facile à gérer.
Il est parfois judicieux de récupérer cette table et de la manipuler localement à l'aide d'un outil tel que pandas. Les Spark DataFrames facilitent cette opération grâce à la méthode .toPandas(). L'appel de cette méthode sur un Spark DataFrame renvoie le DataFrame correspondant pandas. C'est aussi simple que cela.
Cette fois-ci, la requête compte le nombre de vols à destination de chaque aéroport depuis SEA et PDX.
Veuillez noter qu'il existe déjà un SparkSession intitulé spark dans votre espace de travail.
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
- Veuillez exécuter la requête en utilisant la méthode
.sql(). Veuillez enregistrer le résultat dans le fichierflight_counts. - Veuillez utiliser la méthode
.toPandas()surflight_countspour créer un DataFramepandasnommépd_counts. - Affichez
.head()depd_countssur la console.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)