ReduceByKey и Collect
Одно из самых популярных преобразований парных RDD — reduceByKey(). Оно работает с парами «ключ — значение» (k, v) и объединяет значения для каждого ключа. В этом упражнении вы сначала создадите парный RDD из списка кортежей, затем объедините значения с одинаковыми ключами и выведете результат.
Напомним, что SparkContext sc уже доступен в вашем рабочем пространстве.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Создайте парный RDD с именем
Rddиз кортежей(1,2),(3,4),(3,6),(4,5). - Примените к
RddпреобразованиеreduceByKey(), чтобы получить парный RDDRdd_Reduced, сложив значения с одинаковыми ключами. - Соберите содержимое парного RDD
Rdd_Reducedи выведите результаты с помощью итерации.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))