综合练习 II
创建一个 DataFrame,进行一系列转换,将其缓存,并检查它是否已被缓存。然后,取消缓存以释放内存。
本练习已为您提供 spark 会话!请仔细查看 .explain() 方法的输出,以理解最终的执行计划和结果!
本练习是课程的一部分
PySpark 入门
练习说明
- 缓存
dfDataFrame。 - 使用
.explain()解释agg_resultDataFrame 的处理过程。 - 处理完成后对已缓存的
dfDataFrame 调用 unpersist 以取消缓存。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____