收集 RDD
在這個練習中,你會同時使用 PySpark 的 RDD 與 DataFrame。目標是透過 RDD 操作與 DataFrame 方法進行分組並做彙總。
你會將包含員工薪資資料的 CSV 檔載入 PySpark 並作為 RDD。接著,依據資歷層級進行分組,並從 DataFrame 計算各資歷層級的最高薪資。透過這樣的比較,你可以看出兩種資料格式各自的優勢。
你使用的資料集與 Data Scientist 薪資相關,所以找出市場趨勢對你很有幫助!我們已替你載入並正規化資料!記得,你的工作環境中已經有一個名為 spark 的 SparkSession!
本練習屬於課程
PySpark 入門
練習說明
- 從 DataFrame 建立一個 RDD。
- 收集並顯示 RDD 與 DataFrame 的結果。
- 依據
"experience_level"分組並計算各組的最高薪資。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____