Bắt đầu ngayBắt đầu miễn phí

Luyện tập chuẩn hóa (standardization)

Rất rủi ro nếu dùng KNN một cách mù quáng trên các phân phối chưa biết. Hiệu năng của nó giảm mạnh khi các phân phối của đặc trưng không cùng thang đo. Các đặc trưng chưa được scale sẽ làm sai lệch tính toán khoảng cách và trả về điểm bất thường không thực tế.

Một kỹ thuật phổ biến để khắc phục là chuẩn hóa (standardization), bằng cách trừ đi giá trị trung bình của một đặc trưng rồi chia cho độ lệch chuẩn. Cách này giúp đặc trưng có trung bình 0 và phương sai 1.

Hãy luyện tập chuẩn hóa trên dữ liệu females, đã được nạp sẵn cho bạn.

Bài tập này là một phần của khóa học

Phát hiện bất thường với Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo một thể hiện của StandardScaler() và lưu là ss.
  • Trích xuất mảng đặc trưng và mục tiêu vào Xy. Cột mục tiêu là weightkg.
  • Fit StandardScaler() lên X và transform đồng thời.
  • Lặp lại bước trên nhưng giữ nguyên tên cột của DataFrame X.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from sklearn.preprocessing import StandardScaler

# Initialize a StandardScaler
ss = ____

# Extract feature and target arrays
X = ____ 
y = ____

# Fit/transform X
X_transformed = ____

# Fit/transform X but preserve the column names
X.____ = ____
Chỉnh sửa và Chạy Mã