读取 CSV 并执行聚合
您有一份数据科学家薪资的表格,涵盖从小型到大型公司的数据。您想按公司规模分组,比较平均薪资是否存在显著差异。
请注意,您的工作区中已经有一个 SparkSession,名为 spark!
本练习是课程的一部分
PySpark 入门
练习说明
- 将一个 CSV 文件加载为 DataFrame,并推断 schema。
- 返回行数统计。
- 按
company_size列分组,并使用salary_in_usd计算平均薪资。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()