開始使用免費開始

快取實作練習:SQL

先前我們檢視了兩個 DataFrame:df1df2(由 df1 建立)。我們嘗試快取 df1,但沒有快取 df2。在這個練習中,會改成快取 df2,而不快取 df1

同樣地,請留意每個動作所花的時間。我們會在下一個練習中比較這些結果。哪些任務變快了?哪些變慢了?

本練習屬於課程

Python Spark SQL 入門

檢視課程

練習說明

  • 快取 df2,但不要快取 df1
  • 先對 df1 執行一個 action 並重複一次,接著對 df2 執行一個 action 並重複一次。這部分已幫你完成。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
編輯並執行程式碼