Agrégations dans PySpark
Vous êtes maintenant prêt à faire vos propres agrégations !
Vous allez utiliser un jeu de données de salaires que vous avez déjà manipulé. Voyons quelles agrégations vous pouvez créer.
Une SparkSession appelée spark est déjà chargée dans votre espace de travail, ainsi que le DataFrame Spark salaries_df.
Cette activité fait partie du cours
Introduction à PySpark
Instructions de l’exercice
- Trouvez le salaire minimal dans une entreprise américaine de petite taille (Small) — effectuez le filtrage en référant la colonne directement (
"salary_in_usd"), sans passer une chaîne SQL. - Trouvez le salaire maximal dans une entreprise américaine de grande taille (Large), indiquée par
"L"— effectuez le filtrage en référant la colonne directement ("salary_in_usd"), sans passer une chaîne SQL.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()