Začněte nyníZačněte zdarma

ReduceByKey a Collect

Jedna z nejpoužívanějších transformací párového RDD je reduceByKey(), která pracuje s páry klíč–hodnota (k,v) a slučuje hodnoty se stejným klíčem. V tomto cvičení nejprve vytvoříš párové RDD ze seznamu tuplů, pak sloučíš hodnoty se stejným klíčem a nakonec výsledek vypíšeš.

Nezapomeň, že SparkContext sc máš v pracovním prostoru již připravený.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř párové RDD s názvem Rdd obsahující tuply (1,2), (3,4), (3,6), (4,5).
  • Transformuj Rdd pomocí reduceByKey() na párové RDD Rdd_Reduced sečtením hodnot se stejným klíčem.
  • Načti obsah párového RDD Rdd_Reduced a projdi ho, aby se výsledek vypsal.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
Upravit a spustit kód