Bộ nhớ đệm (cache) một DataFrame
Bạn được giao một nhiệm vụ cần chạy nhiều thao tác phân tích trên một DataFrame. Bạn biết rằng việc dùng bộ nhớ đệm (caching) có thể cải thiện hiệu năng khi tái sử dụng các DataFrame và muốn áp dụng nó.
Bạn sẽ làm việc với một tập dữ liệu mới gồm thông tin chuyến bay cất cánh. Dữ liệu có thể bị lặp và cần được loại bỏ trùng lặp.
DataFrame departures_df đã được định nghĩa, nhưng chưa có thao tác nào được thực thi.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với PySpark
Hướng dẫn bài tập
- Đưa các hàng duy nhất của DataFrame
departures_dfvào bộ nhớ đệm (cache). - Thực hiện truy vấn đếm (count) trên
departures_df, ghi nhận thời gian chạy. - Đếm lại các hàng, ghi nhận sự khác biệt về thời gian khi DataFrame đã được cache.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))