Luyện tập chuẩn hóa (standardization)
Rất rủi ro nếu dùng KNN một cách mù quáng trên các phân phối chưa biết. Hiệu năng của nó giảm mạnh khi các phân phối của đặc trưng không cùng thang đo. Các đặc trưng chưa được scale sẽ làm sai lệch tính toán khoảng cách và trả về điểm bất thường không thực tế.
Một kỹ thuật phổ biến để khắc phục là chuẩn hóa (standardization), bằng cách trừ đi giá trị trung bình của một đặc trưng rồi chia cho độ lệch chuẩn. Cách này giúp đặc trưng có trung bình 0 và phương sai 1.
Hãy luyện tập chuẩn hóa trên dữ liệu females, đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Phát hiện bất thường với Python
Hướng dẫn bài tập
- Tạo một thể hiện của
StandardScaler()và lưu làss. - Trích xuất mảng đặc trưng và mục tiêu vào
Xvày. Cột mục tiêu làweightkg. - Fit
StandardScaler()lên X và transform đồng thời. - Lặp lại bước trên nhưng giữ nguyên tên cột của DataFrame
X.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____