RDD を収集する
この演習では、PySpark で RDD と DataFrame の両方を使って作業します。RDD 操作と DataFrame のメソッドを使い、データをグループ化して集計を行うことが目標です。
従業員の給与データが含まれる CSV ファイルを PySpark に RDD として読み込みます。次に、経験レベルでグループ化し、DataFrame から各経験レベルの最大給与を計算します。この作業を通じて、2 つのデータ形式それぞれの強みを理解できます。
使用するデータセットはデータサイエンティストの給与に関するものです。市場のトレンドを把握しておくことは、きっと役に立つでしょう。データの読み込みと正規化はすでに完了しています。なお、ワークスペースには SparkSession として spark がすでに用意されています。
この演習はコースの一部です
PySpark 入門
演習の手順
- DataFrame から RDD を作成します。
- RDD と DataFrame の結果を収集して表示します。
- でグループ化し、各 の最大給与を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____