ÎncepețiÎncepe gratuit

ReduceByKey și Collect

Una dintre cele mai utilizate transformări pe perechi RDD este reduceByKey(), care operează pe perechi cheie-valoare (k, v) și combină valorile pentru fiecare cheie. În acest exercițiu, vei crea mai întâi un RDD de perechi dintr-o listă de tupluri, vei combina valorile cu aceeași cheie și, în final, vei afișa rezultatul.

Amintește-ți că ai deja un SparkContext sc disponibil în spațiul de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un RDD de perechi numit Rdd cu tuplurile (1,2), (3,4), (3,6), (4,5).
  • Transformă Rdd cu reduceByKey() într-un RDD de perechi numit Rdd_Reduced, adunând valorile cu aceeași cheie.
  • Colectează conținutul RDD-ului de perechi Rdd_Reduced și iterează pentru a afișa rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
Editează și rulează codul