開始使用免費開始

讀取 CSV 並進行彙總運算

你手上有一份資料科學家薪資的試算表,來源公司從小型到大型皆有。你想檢視依公司規模分組後的平均薪資是否有明顯差異。

請記得,你的工作區中已經有一個名為 sparkSparkSession

本練習屬於課程

PySpark 入門

檢視課程

練習說明

  • 將一個 CSV 檔載入為 DataFrame,並自動推斷綱要(schema)。
  • 回傳資料列數量的計數。
  • 依欄位 company_size 分組,並使用 salary_in_usd 計算平均薪資。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
編輯並執行程式碼