始める無料で始める

RDD を収集する

この演習では、PySpark で RDD と DataFrame の両方を使って作業します。RDD 操作と DataFrame のメソッドを使い、データをグループ化して集計を行うことが目標です。

従業員の給与データが含まれる CSV ファイルを PySpark に RDD として読み込みます。次に、経験レベルでグループ化し、DataFrame から各経験レベルの最大給与を計算します。この作業を通じて、2 つのデータ形式それぞれの強みを理解できます。

使用するデータセットはデータサイエンティストの給与に関するものです。市場のトレンドを把握しておくことは、きっと役に立つでしょう。データの読み込みと正規化はすでに完了しています。なお、ワークスペースには SparkSession として spark がすでに用意されています。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • DataFrame から RDD を作成します。
  • RDD と DataFrame の結果を収集して表示します。
  • でグループ化し、各 の最大給与を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
コードを編集して実行