Bắt đầu ngayBắt đầu miễn phí

Gộp dữ liệu bằng PySpark

Trong bài tập này, bạn sẽ tải lên ba tệp vào lakehouse, đại diện cho một dimension game kiểu snowflake: danh sách video game trong một tệp, thể loại (genres) trong tệp thứ hai và nhà phát hành (publishers) trong tệp thứ ba. Mục tiêu là gộp chúng thành một bảng duy nhất bằng cách dùng PySpark để thực hiện join.

Lưu ý: Nếu bạn gặp lỗi về giới hạn tần suất API (API rate limit), thường là do một tác vụ Fabric trước đó chưa hoàn tất. Bạn có thể xem các tác vụ Fabric đang chạy trong trang Monitor (nằm ở menu dọc bên trái). Hủy các tác vụ Fabric cũ trong trang Monitor thường sẽ khắc phục lỗi rate limit.

Bài tập này là một phần của khóa học

Biến đổi và Phân tích Dữ liệu với Microsoft Fabric

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập