CommencezCommencez gratuitement

Agrégations dans PySpark

Vous êtes maintenant prêt à faire vos propres agrégations ! Vous allez utiliser un jeu de données de salaires que vous avez déjà manipulé. Voyons quelles agrégations vous pouvez créer. Une SparkSession appelée spark est déjà chargée dans votre espace de travail, ainsi que le DataFrame Spark salaries_df.

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Trouvez le salaire minimal dans une entreprise américaine de petite taille (Small) — effectuez le filtrage en référant la colonne directement ("salary_in_usd"), sans passer une chaîne SQL.
  • Trouvez le salaire maximal dans une entreprise américaine de grande taille (Large), indiquée par "L" — effectuez le filtrage en référant la colonne directement ("salary_in_usd"), sans passer une chaîne SQL.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
Modifier et exécuter le code