CommencezCommencez gratuitement

Récupérer des RDD

Dans cet exercice, vous travaillerez à la fois avec des RDD et des DataFrames dans PySpark. L'objectif est de regrouper des données et d'effectuer des agrégations en utilisant à la fois des opérations RDD et des méthodes de DataFrame.

Vous chargerez dans PySpark, sous forme de RDD, un fichier CSV contenant des données de salaires d'employés. Vous regrouperez ensuite par niveau d'expérience et calculerez le salaire maximal pour chaque niveau d'expérience à partir d'un DataFrame. Vous pourrez ainsi comparer les forces de ces deux formats de données.

Le jeu de données porte sur les salaires des Data Scientists, donc repérer les tendances du marché est dans votre intérêt ! Nous avons déjà chargé et normalisé les données pour vous ! N'oubliez pas qu'une SparkSession nommée spark est déjà disponible dans votre espace de travail !

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Créez un RDD à partir d'un DataFrame.
  • Récupérez et affichez les résultats du RDD et du DataFrame.
  • Regroupez par "experience_level" et calculez le salaire maximal pour chacun.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
Modifier et exécuter le code