ReduceByKey і Collect
Одне з найпопулярніших перетворень парних RDD — це reduceByKey(), яке працює з парами ключ–значення (k, v) і об'єднує значення для кожного ключа. У цій вправі ви спочатку створите парний RDD зі списку кортежів, потім об'єднаєте значення з однаковим ключем і, нарешті, виведете результат.
Пам'ятайте: у вашому робочому середовищі вже доступний SparkContext sc.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Створіть парний RDD з назвою
Rddіз кортежів(1,2),(3,4),(3,6),(4,5). - Перетворіть
Rddза допомогоюreduceByKey()на парний RDDRdd_Reduced, додаючи значення з однаковим ключем. - Зберіть вміст парного RDD
Rdd_Reducedі проітерайтеся ним, щоб надрукувати результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))