ПочатиПочніть безкоштовно

ReduceByKey і Collect

Одне з найпопулярніших перетворень парних RDD — це reduceByKey(), яке працює з парами ключ–значення (k, v) і об'єднує значення для кожного ключа. У цій вправі ви спочатку створите парний RDD зі списку кортежів, потім об'єднаєте значення з однаковим ключем і, нарешті, виведете результат.

Пам'ятайте: у вашому робочому середовищі вже доступний SparkContext sc.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть парний RDD з назвою Rdd із кортежів (1,2),(3,4),(3,6),(4,5).
  • Перетворіть Rdd за допомогою reduceByKey() на парний RDD Rdd_Reduced, додаючи значення з однаковим ключем.
  • Зберіть вміст парного RDD Rdd_Reduced і проітерайтеся ним, щоб надрукувати результат.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
Редагувати та запускати код