始める無料で始める

ReduceByKey と Collect

最もよく使われるペア RDD の変換の一つが reduceByKey() です。これはキーと値のペア (k, v) に対して動作し、キーごとに値をマージします。この演習では、まずタプルのリストからペア RDD を作成し、次に同じキーの値を結合し、最後に結果を出力します。

ワークスペースにはすでに SparkContext sc が用意されています。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • タプル (1,2),(3,4),(3,6),(4,5) から、Rdd という名前のペア RDD を作成します。
  • RddreduceByKey() を適用し、同じキーの値を加算して、Rdd_Reduced というペア RDD に変換します。
  • ペア RDD Rdd_Reduced の内容を collect して、反復しながら出力を表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
コードを編集して実行