CommencezCommencez gratuitement

Agrégation

Toutes les méthodes d'agrégation courantes, comme .min(), .max() et .count(), sont des méthodes de GroupedData. Celles-ci sont créées en appelant la méthode .groupBy() d'un DataFrame. Vous verrez exactement ce que cela signifie dans quelques exercices. Pour l'instant, tout ce que vous avez à faire pour utiliser ces fonctions, c'est d'appeler cette méthode sur votre DataFrame. Par exemple, pour trouver la valeur minimale d'une colonne col dans un DataFrame df, vous pourriez faire

df.groupBy().min("col").show()

Cela crée un objet GroupedData (ce qui vous permet d'utiliser la méthode .min()), puis trouve la valeur minimale dans col et la renvoie sous forme de DataFrame.

Vous êtes maintenant prêt à faire vos propres agrégations!

Un SparkSession nommé spark est déjà disponible dans votre espace de travail, ainsi que le DataFrame Spark flights.

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Trouvez la longueur du vol le plus court (en distance) ayant quitté PDX en utilisant d'abord .filter() puis la méthode .min(). Effectuez le filtrage en référant directement à la colonne, sans passer de chaîne SQL.
  • Trouvez la longueur du vol le plus long (en durée) ayant quitté SEA en utilisant filter() puis la méthode .max(). Effectuez le filtrage en référant directement à la colonne, sans passer de chaîne SQL.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Find the shortest flight from PDX in terms of distance
flights.filter(____.____ == ____).groupBy().____(____).show()

# Find the longest flight from SEA in terms of air time
flights.filter(____).groupBy().____.show()
Modifier et exécuter le code