reduceByKey et collect
L'une des transformations les plus utilisées sur les RDD de paires est reduceByKey(), qui agit sur des paires clé-valeur (k, v) et fusionne les valeurs pour chaque clé. Dans cet exercice, vous allez d'abord créer un RDD de paires à partir d'une liste de tuples, puis combiner les valeurs ayant la même clé et, enfin, afficher le résultat.
Rappel : vous avez déjà un SparkContext sc disponible dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez un RDD de paires nommé
Rddavec les tuples(1,2),(3,4),(3,6),(4,5). - Transformez
RddavecreduceByKey()en un RDD de pairesRdd_Reduceden additionnant les valeurs ayant la même clé. - Récupérez le contenu du RDD de paires
Rdd_Reducedet itérez pour afficher le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))