시작하기무료로 시작하기

ReduceBykey와 Collect

가장 널리 쓰이는 pair RDD 변환 중 하나는 reduceByKey()입니다. 이 메서드는 키-값 (k,v) 쌍에서 동작하며 키별로 값을 병합해요. 이 연습 문제에서는 먼저 튜플 리스트로부터 pair RDD를 만든 다음, 같은 키의 값을 합치고, 마지막으로 결과를 출력해 보겠습니다.

워크스페이스에는 이미 SparkContext sc가 준비되어 있다는 점을 기억하세요.

이 연습은 강의의 일부입니다

PySpark로 배우는 빅데이터 기초

강의 보기

연습 안내

  • (1,2), (3,4), (3,6), (4,5) 튜플로 pair RDD Rdd를 생성하세요.
  • 같은 키의 값을 더해 reduceByKey()Rdd를 변환하여 pair RDD Rdd_Reduced를 만드세요.
  • pair RDD Rdd_Reduced의 내용을 collect한 뒤, 순회하며 출력을 인쇄하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
코드 편집 및 실행