Bắt đầu ngayBắt đầu miễn phí

Bù khuyết đơn giản (Simple imputation)

Như bạn đã thấy ở bài trước, xóa dữ liệu có thể làm giảm kích thước tập dữ liệu quá nhiều. Trong bối cảnh phỏng vấn, điều này có thể dẫn đến kết quả lệch cho mô hình Machine Learning của bạn.

Một cách linh hoạt hơn để xử lý giá trị thiếu là bù khuyết (impute). Có nhiều cách thực hiện điều này trong Python, nhưng trong bài này bạn sẽ dùng hàm SimpleImputer() từ mô-đun sklearn.impute trên loan_data.

Sau đó, bạn sẽ dùng pandasnumpy để chuyển tập dữ liệu đã bù khuyết thành một DataFrame.

Lưu ý rằng hiện có thêm 2 bước trong pipeline, InstantiateFit: Machine learning pipeline

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import imputer module
from sklearn.impute import SimpleImputer

# Subset numeric features: numeric_cols
numeric_cols = ____.____(include=[____.____])
Chỉnh sửa và Chạy Mã