Récupérer des RDD
Dans cet exercice, vous travaillerez à la fois avec des RDD et des DataFrames dans PySpark. L'objectif est de regrouper des données et d'effectuer des agrégations en utilisant à la fois des opérations RDD et des méthodes de DataFrame.
Vous chargerez dans PySpark, sous forme de RDD, un fichier CSV contenant des données de salaires d'employés. Vous regrouperez ensuite par niveau d'expérience et calculerez le salaire maximal pour chaque niveau d'expérience à partir d'un DataFrame. Vous pourrez ainsi comparer les forces de ces deux formats de données.
Le jeu de données porte sur les salaires des Data Scientists, donc repérer les tendances du marché est dans votre intérêt ! Nous avons déjà chargé et normalisé les données pour vous ! N'oubliez pas qu'une SparkSession nommée spark est déjà disponible dans votre espace de travail !
Cette activité fait partie du cours
Introduction à PySpark
Instructions de l’exercice
- Créez un RDD à partir d'un DataFrame.
- Récupérez et affichez les résultats du RDD et du DataFrame.
- Regroupez par
"experience_level"et calculez le salaire maximal pour chacun.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____