Lecture d'un CSV et calculs d'agrégats
Vous disposez d'une feuille de calcul sur les salaires de Data Scientists provenant d'entreprises de petite, moyenne et grande tailles. Vous souhaitez vérifier s'il existe une différence marquée entre les salaires moyens selon la taille de l'entreprise.
N'oubliez pas qu'une SparkSession nommée spark est déjà disponible dans votre espace de travail!
Cette activité fait partie du cours
Introduction à PySpark
Instructions de l’exercice
- Chargez un fichier CSV comme DataFrame et inférez le schéma.
- Retournez le nombre de lignes.
- Regroupez par la colonne
company_sizeet calculez le salaire moyen avecsalary_in_usd.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()