Bắt đầu ngayBắt đầu miễn phí

Thực hành caching: phần SQL

Trước đó, chúng ta đã xem hai DataFrame: df1df2 (được tạo từ df1). Chúng ta đã thử cache df1, nhưng không cache df2. Trong bài này, bạn sẽ kiểm tra tác động của việc cache df2 nhưng không cache df1.

Một lần nữa, hãy ghi nhận thời gian mà mỗi action mất để chạy. Chúng ta sẽ so sánh chúng ở bài tiếp theo. Nhiệm vụ nào chạy nhanh hơn? Nhiệm vụ nào chậm lại?

Bài tập này là một phần của khóa học

Nhập môn Spark SQL bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Cache df2, nhưng không cache df1.
  • Chạy một action đầu tiên trên df1 rồi lặp lại, sau đó chạy một action trên df2 rồi lặp lại. Phần này đã được chuẩn bị sẵn cho bạn.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
Chỉnh sửa và Chạy Mã