开始使用免费开始使用

综合练习 II

创建一个 DataFrame,进行一系列转换,将其缓存,并检查它是否已被缓存。然后,取消缓存以释放内存。 本练习已为您提供 spark 会话!请仔细查看 .explain() 方法的输出,以理解最终的执行计划和结果!

本练习是课程的一部分

PySpark 入门

查看课程

练习说明

  • 缓存 df DataFrame。
  • 使用 .explain() 解释 agg_result DataFrame 的处理过程。
  • 处理完成后对已缓存的 df DataFrame 调用 unpersist 以取消缓存。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
编辑并运行代码