讀取 CSV 並進行彙總運算
你手上有一份資料科學家薪資的試算表,來源公司從小型到大型皆有。你想檢視依公司規模分組後的平均薪資是否有明顯差異。
請記得,你的工作區中已經有一個名為 spark 的 SparkSession!
本練習屬於課程
PySpark 入門
練習說明
- 將一個 CSV 檔載入為 DataFrame,並自動推斷綱要(schema)。
- 回傳資料列數量的計數。
- 依欄位
company_size分組,並使用salary_in_usd計算平均薪資。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()