ReduceByKey și Collect
Una dintre cele mai utilizate transformări pe perechi RDD este reduceByKey(), care operează pe perechi cheie-valoare (k, v) și combină valorile pentru fiecare cheie. În acest exercițiu, vei crea mai întâi un RDD de perechi dintr-o listă de tupluri, vei combina valorile cu aceeași cheie și, în final, vei afișa rezultatul.
Amintește-ți că ai deja un SparkContext sc disponibil în spațiul de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Creează un RDD de perechi numit
Rddcu tuplurile(1,2),(3,4),(3,6),(4,5). - Transformă
RddcureduceByKey()într-un RDD de perechi numitRdd_Reduced, adunând valorile cu aceeași cheie. - Colectează conținutul RDD-ului de perechi
Rdd_Reducedși iterează pentru a afișa rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))