CommencerCommencez gratuitement

Agrégation

Toutes les méthodes d'agrégation courantes, telles que .min(), .max() et .count(), sont des méthodes GroupedData. Elles sont créées en appelant la méthode DataFrame .groupBy(). Vous apprendrez exactement ce que cela signifie à travers quelques exercices. Pour l'instant, il vous suffit d'appeler cette méthode sur votre DataFrame pour utiliser ces fonctions. Par exemple, pour déterminer la valeur minimale d'une colonne, col, dans un DataFrame, df, vous pouvez procéder comme suit :

df.groupBy().min("col").show()

Cela crée un objet GroupedData (ce qui vous permet d'utiliser la méthode .min()), puis recherche la valeur minimale dans col et la renvoie sous forme de DataFrame.

Vous êtes désormais prêt à effectuer vos propres agrégations.

Un SparkSession nommé spark se trouve déjà dans votre espace de travail, ainsi que le Spark DataFrame flights.

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Veuillez déterminer la durée du vol le plus court (en termes de distance) au départ de PDX en effectuant d'abord une recherche sur .filter()et en utilisant la méthode .min(). Effectuez le filtrage en référençant directement la colonne, sans transmettre de chaîne SQL.
  • Veuillez déterminer la durée du vol le plus long (en termes de temps) au départ de SEA en utilisant la méthode filter() et .max(). Effectuez le filtrage en référençant directement la colonne, sans transmettre de chaîne SQL.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Find the shortest flight from PDX in terms of distance
flights.filter(____.____ == ____).groupBy().____(____).show()

# Find the longest flight from SEA in terms of air time
flights.filter(____).groupBy().____.show()
Modifier et exécuter le code