Thực hành caching: phần SQL
Trước đó, chúng ta đã xem hai DataFrame: df1 và df2 (được tạo từ df1). Chúng ta đã thử cache df1, nhưng không cache df2. Trong bài này, bạn sẽ kiểm tra tác động của việc cache df2 nhưng không cache df1.
Một lần nữa, hãy ghi nhận thời gian mà mỗi action mất để chạy. Chúng ta sẽ so sánh chúng ở bài tiếp theo. Nhiệm vụ nào chạy nhanh hơn? Nhiệm vụ nào chậm lại?
Bài tập này là một phần của khóa học
Nhập môn Spark SQL bằng Python
Hướng dẫn bài tập
- Cache
df2, nhưng không cachedf1. - Chạy một action đầu tiên trên
df1rồi lặp lại, sau đó chạy một action trêndf2rồi lặp lại. Phần này đã được chuẩn bị sẵn cho bạn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)