Chọn đúng chỉ số chất lượng
Một kỹ sư mới tại Global Retail Analytics chạy pipeline làm sạch trên lần tải lên online_retail mới, nhưng vô tình ghi chú (comment out) dòng na.drop(subset=["CustomerID"]). Các bước còn lại - na.fill(), dropDuplicates(), và bộ lọc bản ghi không hợp lệ - đều chạy không lỗi.
Chỉ số kiểm tra chất lượng nào sẽ lập tức lộ ra sai sót này?
Bài tập này là một phần của khóa học
Chuyển đổi dữ liệu với Spark SQL trong Databricks
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập