始める無料で始める

RDD で集計する

PySpark の DataFrame を使った分析を行いましたが、今度は同様の処理を RDD で実行してみましょう。提供されているコードを使って、PySpark の RDD に含まれる値の合計を求めます。

spark という名前の Spark セッションはすでに作成済みです。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • 提供されている DataFrame から RDD を作成してください。
  • 提供されている Lambda 関数を RDD のキーに適用してください。
  • 集計結果を収集してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# DataFrame Creation
data = [("HR", "3000"), ("IT", "4000"), ("Finance", "3500")]
columns = ["Department", "Salary"]
df = spark.createDataFrame(data, schema=columns)

# Map the DataFrame to an RDD
rdd = df.rdd.____(lambda row: (row["Department"], row["Salary"]))

# Apply a lambda function to get the sum of the DataFrame
rdd_aggregated = rdd.____(lambda x, y: x + y)

# Show the collected Results
print(rdd_aggregated.____())
コードを編集して実行