ReduceByKey と Collect
最もよく使われるペア RDD の変換の一つが reduceByKey() です。これはキーと値のペア (k, v) に対して動作し、キーごとに値をマージします。この演習では、まずタプルのリストからペア RDD を作成し、次に同じキーの値を結合し、最後に結果を出力します。
ワークスペースにはすでに SparkContext sc が用意されています。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
- タプル
(1,2),(3,4),(3,6),(4,5)から、Rddという名前のペア RDD を作成します。 RddにreduceByKey()を適用し、同じキーの値を加算して、Rdd_Reducedというペア RDD に変換します。- ペア RDD
Rdd_Reducedの内容を collect して、反復しながら出力を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))