開始使用免費開始

收集 RDD

在這個練習中,你會同時使用 PySpark 的 RDD 與 DataFrame。目標是透過 RDD 操作與 DataFrame 方法進行分組並做彙總。

你會將包含員工薪資資料的 CSV 檔載入 PySpark 並作為 RDD。接著,依據資歷層級進行分組,並從 DataFrame 計算各資歷層級的最高薪資。透過這樣的比較,你可以看出兩種資料格式各自的優勢。

你使用的資料集與 Data Scientist 薪資相關,所以找出市場趨勢對你很有幫助!我們已替你載入並正規化資料!記得,你的工作環境中已經有一個名為 sparkSparkSession

本練習屬於課程

PySpark 入門

檢視課程

練習說明

  • 從 DataFrame 建立一個 RDD。
  • 收集並顯示 RDD 與 DataFrame 的結果。
  • 依據 "experience_level" 分組並計算各組的最高薪資。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____

# Collect and print the results
print(rdd_salaries.____)

# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})

# Show the results
dataframe_results.____
編輯並執行程式碼