sortByKey et collect
Il est souvent utile de trier un RDD de paires selon la clé (par exemple, pour le décompte de mots que vous verrez plus loin dans le chapitre). Dans cet exercice, vous allez trier le RDD de paires Rdd_Reduced que vous avez créé à l'exercice précédent en ordre décroissant, puis afficher le résultat final.
N'oubliez pas : vous disposez déjà d'un SparkContext sc et de Rdd_Reduced dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Triez le RDD
Rdd_Reducedà l'aide de la clé en ordre décroissant. - Récupérez le contenu avec collect et itérez pour afficher le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Sort the reduced RDD with the key by descending order
Rdd_Reduced_Sort = Rdd_Reduced.____(ascending=False)
# Iterate over the result and retrieve all the elements of the RDD
for num in Rdd_Reduced_Sort.____():
print("Key {} has {} Counts".format(____, num[1]))