Tổng hợp mọi thứ II
Tạo một DataFrame, áp dụng các biến đổi, lưu đệm (cache) nó và kiểm tra xem nó đã được lưu đệm chưa. Sau đó, bỏ lưu đệm để giải phóng bộ nhớ.
Trong bài này, một phiên spark đã được tạo sẵn cho bạn! Hãy xem kỹ kết quả của phương thức .explain() để hiểu kết quả là gì!
Bài tập này là một phần của khóa học
Nhập môn PySpark
Hướng dẫn bài tập
- Lưu đệm (cache) DataFrame
df. - Giải thích quá trình xử lý của DataFrame
agg_result. - Gỡ lưu đệm (unpersist) DataFrame
dfđã lưu đệm sau khi xử lý.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Cache the DataFrame
df.____
# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()
# Analyze the execution plan
agg_result.____
# Uncache the DataFrame
df.____