Tiếp tục sau khi khởi động lại
Pipeline streaming của bạn tại Global Retail Analytics nhận các tệp CSV mới từ một Unity Catalog volume và ghi chúng vào Delta Lake. Sau một sự cố cuối tuần, cụm được khởi động lại vào sáng thứ Hai. Có ba tệp mới đến trong cuối tuần. Stream chỉ xử lý ba tệp đó — không tệp nào từ tuần trước được nạp lại.
Điều gì giúp stream bỏ qua các tệp đã xử lý trước đó và tiếp tục chính xác từ nơi nó dừng?
Bài tập này là một phần của khóa học
Chuyển đổi dữ liệu với Spark SQL trong Databricks
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập