缓存练习:SQL
之前,我们查看过两个 DataFrame:df1 和 df2(df2 由 df1 创建)。我们尝试缓存了 df1,但没有缓存 df2。本练习中,我们将只缓存 df2,而不缓存 df1,并观察其影响。
同样,请记录每个 action 所花费的时间。我们会在下一个练习中进行比较。哪些任务更快了?哪些变慢了?
本练习是课程的一部分
Python 中的 Spark SQL 入门
练习说明
- 只缓存
df2,不要缓存df1。 - 先对
df1运行一次 action 并重复运行,然后对df2运行一次 action 并重复运行。代码已为您写好。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)