开始使用免费开始使用

读取 CSV 并执行聚合

您有一份数据科学家薪资的表格,涵盖从小型到大型公司的数据。您想按公司规模分组,比较平均薪资是否存在显著差异。

请注意,您的工作区中已经有一个 SparkSession,名为 spark

本练习是课程的一部分

PySpark 入门

查看课程

练习说明

  • 将一个 CSV 文件加载为 DataFrame,并推断 schema。
  • 返回行数统计。
  • company_size 列分组,并使用 salary_in_usd 计算平均薪资。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
编辑并运行代码