Các bước của pipeline dữ liệu
Một trong những pipeline dữ liệu quan trọng với hoạt động kinh doanh tại Sierra Publishing dựa vào một luồng dữ liệu tốc độ cao đến từ Kafka. Chúng ta cần đọc dữ liệu và join với một vài bộ dữ liệu khác.

Đội kỹ sư dữ liệu của bạn muốn dùng Databricks để tối ưu pipeline này và cho phép các nhóm sử dụng phía sau đọc dữ liệu theo thời gian thực để phục vụ phân tích.
Bài tập này là một phần của khóa học
Các khái niệm về Databricks
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập