ReduceBykey와 Collect
가장 널리 쓰이는 pair RDD 변환 중 하나는 reduceByKey()입니다. 이 메서드는 키-값 (k,v) 쌍에서 동작하며 키별로 값을 병합해요. 이 연습 문제에서는 먼저 튜플 리스트로부터 pair RDD를 만든 다음, 같은 키의 값을 합치고, 마지막으로 결과를 출력해 보겠습니다.
워크스페이스에는 이미 SparkContext sc가 준비되어 있다는 점을 기억하세요.
이 연습은 강의의 일부입니다
PySpark로 배우는 빅데이터 기초
연습 안내
(1,2),(3,4),(3,6),(4,5)튜플로 pair RDDRdd를 생성하세요.- 같은 키의 값을 더해
reduceByKey()로Rdd를 변환하여 pair RDDRdd_Reduced를 만드세요. - pair RDD
Rdd_Reduced의 내용을 collect한 뒤, 순회하며 출력을 인쇄하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))