Bù khuyết đơn giản (Simple imputation)
Như bạn đã thấy ở bài trước, xóa dữ liệu có thể làm giảm kích thước tập dữ liệu quá nhiều. Trong bối cảnh phỏng vấn, điều này có thể dẫn đến kết quả lệch cho mô hình Machine Learning của bạn.
Một cách linh hoạt hơn để xử lý giá trị thiếu là bù khuyết (impute). Có nhiều cách thực hiện điều này trong Python, nhưng trong bài này bạn sẽ dùng hàm SimpleImputer() từ mô-đun sklearn.impute trên loan_data.
Sau đó, bạn sẽ dùng pandas và numpy để chuyển tập dữ liệu đã bù khuyết thành một DataFrame.
Lưu ý rằng hiện có thêm 2 bước trong pipeline, Instantiate và Fit:

Bài tập này là một phần của khóa học
Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import imputer module
from sklearn.impute import SimpleImputer
# Subset numeric features: numeric_cols
numeric_cols = ____.____(include=[____.____])