SortByKey와 Collect
키를 기준으로 pair RDD를 정렬하면 유용할 때가 많아요(예를 들어 이 장 후반에 볼 word count 등). 이 연습 문제에서는 이전 연습 문제에서 만든 pair RDD Rdd_Reduced를 내림차순으로 정렬하고 최종 결과를 출력해 보겠습니다.
SparkContext sc와 Rdd_Reduced는 작업 공간에 이미 준비되어 있다는 점을 기억하세요.
이 연습은 강의의 일부입니다
PySpark로 배우는 빅데이터 기초
연습 안내
- 키를 기준으로
Rdd_ReducedRDD를 내림차순으로 정렬하세요. - 내용을 collect 한 뒤 순회하며 결과를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Sort the reduced RDD with the key by descending order
Rdd_Reduced_Sort = Rdd_Reduced.____(ascending=False)
# Iterate over the result and retrieve all the elements of the RDD
for num in Rdd_Reduced_Sort.____():
print("Key {} has {} Counts".format(____, num[1]))