НачатьНачать бесплатно

ReduceByKey и Collect

Одно из самых популярных преобразований парных RDD — reduceByKey(). Оно работает с парами «ключ — значение» (k, v) и объединяет значения для каждого ключа. В этом упражнении вы сначала создадите парный RDD из списка кортежей, затем объедините значения с одинаковыми ключами и выведете результат.

Напомним, что SparkContext sc уже доступен в вашем рабочем пространстве.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте парный RDD с именем Rdd из кортежей (1,2), (3,4), (3,6), (4,5).
  • Примените к Rdd преобразование reduceByKey(), чтобы получить парный RDD Rdd_Reduced, сложив значения с одинаковыми ключами.
  • Соберите содержимое парного RDD Rdd_Reduced и выведите результаты с помощью итерации.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
Редактировать и запускать код