CommencezCommencez gratuitement

Lecture d'un CSV et calculs d'agrégats

Vous disposez d'une feuille de calcul sur les salaires de Data Scientists provenant d'entreprises de petite, moyenne et grande tailles. Vous souhaitez vérifier s'il existe une différence marquée entre les salaires moyens selon la taille de l'entreprise.

N'oubliez pas qu'une SparkSession nommée spark est déjà disponible dans votre espace de travail!

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Chargez un fichier CSV comme DataFrame et inférez le schéma.
  • Retournez le nombre de lignes.
  • Regroupez par la colonne company_size et calculez le salaire moyen avec salary_in_usd.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
Modifier et exécuter le code