Bắt đầu ngayBắt đầu miễn phí

Bộ nhớ đệm (cache) một DataFrame

Bạn được giao một nhiệm vụ cần chạy nhiều thao tác phân tích trên một DataFrame. Bạn biết rằng việc dùng bộ nhớ đệm (caching) có thể cải thiện hiệu năng khi tái sử dụng các DataFrame và muốn áp dụng nó.

Bạn sẽ làm việc với một tập dữ liệu mới gồm thông tin chuyến bay cất cánh. Dữ liệu có thể bị lặp và cần được loại bỏ trùng lặp.

DataFrame departures_df đã được định nghĩa, nhưng chưa có thao tác nào được thực thi.

Bài tập này là một phần của khóa học

Làm sạch dữ liệu với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Đưa các hàng duy nhất của DataFrame departures_df vào bộ nhớ đệm (cache).
  • Thực hiện truy vấn đếm (count) trên departures_df, ghi nhận thời gian chạy.
  • Đếm lại các hàng, ghi nhận sự khác biệt về thời gian khi DataFrame đã được cache.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Chỉnh sửa và Chạy Mã