Bắt đầu ngayBắt đầu miễn phí

Xử lý giá trị ngoại lệ

Trong bài tập trước, bạn đã thấy việc trực quan hóa các điểm ngoại lệ có thể giúp ích thế nào trong một buổi phỏng vấn Machine Learning. Một cách tiện lợi khác để xử lý ngoại lệ là tính Z-score, vốn đặt một ngưỡng cho ngoại lệ xấp xỉ ±3 độ lệch chuẩn so với trung bình.

Trong bài tập này, bạn sẽ dùng mô-đun scipy.stats để tính Z-score với hàm stats.zscore() và dùng hàm mstats.winsorize() để thay thế các điểm ngoại lệ bằng kỹ thuật gọi là Winsorizing.

Nhắc lại từ bài giảng video: những điểm nằm trên và/hoặc dưới 1,5 lần IQR nên được xem xét là ngoại lệ tiềm năng. Ở bước cuối của bài tập này, giá trị đó là 2120.

Các gói liên quan đã được nhập sẵn cho bạn, và các cột số và cột phân loại của loan_data đã được tách và lưu lần lượt là numeric_colscategoric_cols.

Machine learning pipeline

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())

# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)

# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)

# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())
Chỉnh sửa và Chạy Mã