Bắt đầu ngayBắt đầu miễn phí

Tổng hợp mọi thứ II

Tạo một DataFrame, áp dụng các biến đổi, lưu đệm (cache) nó và kiểm tra xem nó đã được lưu đệm chưa. Sau đó, bỏ lưu đệm để giải phóng bộ nhớ. Trong bài này, một phiên spark đã được tạo sẵn cho bạn! Hãy xem kỹ kết quả của phương thức .explain() để hiểu kết quả là gì!

Bài tập này là một phần của khóa học

Nhập môn PySpark

Xem khóa học

Hướng dẫn bài tập

  • Lưu đệm (cache) DataFrame df.
  • Giải thích quá trình xử lý của DataFrame agg_result.
  • Gỡ lưu đệm (unpersist) DataFrame df đã lưu đệm sau khi xử lý.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Cache the DataFrame
df.____

# Perform aggregation
agg_result = df.groupBy("Department").sum("Salary")
agg_result.show()

# Analyze the execution plan
agg_result.____

# Uncache the DataFrame
df.____
Chỉnh sửa và Chạy Mã