ReduceByKey a Collect
Jedna z nejpoužívanějších transformací párového RDD je reduceByKey(), která pracuje s páry klíč–hodnota (k,v) a slučuje hodnoty se stejným klíčem. V tomto cvičení nejprve vytvoříš párové RDD ze seznamu tuplů, pak sloučíš hodnoty se stejným klíčem a nakonec výsledek vypíšeš.
Nezapomeň, že SparkContext sc máš v pracovním prostoru již připravený.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř párové RDD s názvem
Rddobsahující tuply(1,2),(3,4),(3,6),(4,5). - Transformuj
RddpomocíreduceByKey()na párové RDDRdd_Reducedsečtením hodnot se stejným klíčem. - Načti obsah párového RDD
Rdd_Reduceda projdi ho, aby se výsledek vypsal.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))