开始使用免费开始使用

缓存练习:SQL

之前,我们查看过两个 DataFrame:df1df2df2df1 创建)。我们尝试缓存了 df1,但没有缓存 df2。本练习中,我们将只缓存 df2,而不缓存 df1,并观察其影响。

同样,请记录每个 action 所花费的时间。我们会在下一个练习中进行比较。哪些任务更快了?哪些变慢了?

本练习是课程的一部分

Python 中的 Spark SQL 入门

查看课程

练习说明

  • 只缓存 df2,不要缓存 df1
  • 先对 df1 运行一次 action 并重复运行,然后对 df2 运行一次 action 并重复运行。代码已为您写好。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
编辑并运行代码