or
Bài tập này là một phần của khóa học
Trong chương này, bạn sẽ biết vì sao dữ liệu khuyết có thể là rủi ro khi phân tích tập dữ liệu. Bạn sẽ được giới thiệu ba cơ chế gây dữ liệu khuyết và học cách nhận diện chúng bằng kiểm định thống kê và công cụ trực quan hóa.
Làm quen với phân loại các phương pháp imputation và học ba kỹ thuật dựa trên mẫu cho: điền trung bình, hot-deck, và k-Nearest-Neighbors. Bạn sẽ “mở nắp capo” để xem các phương pháp này vận hành thế nào trước khi áp dụng chúng vào một tập dữ liệu thời tiết nhiệt đới thực tế. Đồng thời, bạn cũng sẽ học các mẹo hữu ích để khiến chúng hoạt động hiệu quả hơn cho bài toán của bạn.
Đến lúc học cách dùng các mô hình thống kê và Machine Learning, như hồi quy tuyến tính, hồi quy logistic, và random forest, để thực hiện imputation cho dữ liệu khuyết. Trong chương này, bạn sẽ tìm hiểu cách các mô hình đưa ra dự đoán và dùng kiến thức đó để rút giá trị điền từ các phân phối có điều kiện. Điều này quan trọng vì nó giúp các phép imputation đa dạng và hợp lý hơn, gần với dữ liệu thật hơn.
Các giá trị đã điền không phải bất biến. Chúng chỉ là ước lượng, và mọi ước lượng đều đi kèm bất định. Trong chương cuối, bạn sẽ khám phá cách bootstrapping và chained equations bằng gói mice có thể được dùng để đưa bất định do imputation vào mô hình và phân tích của bạn, giúp chúng đáng tin cậy và vững vàng hơn.
Bài tập hiện tại