Chuẩn hóa (Standardization)
Mặc dù normalization (chuẩn hóa về khoảng) hữu ích để co giãn một cột vào giữa hai mốc giá trị, việc so sánh hai cột đã được scale trở nên khó khăn nếu chỉ một trong chúng bị ngoại lệ (outlier) ảnh hưởng quá mạnh. Một giải pháp thường dùng cho vấn đề này là standardization (chuẩn hóa theo phân phối), trong đó thay vì đặt cận trên và cận dưới cố định, bạn đưa dữ liệu về quanh giá trị trung bình của nó và tính xem mỗi điểm dữ liệu lệch bao nhiêu độ lệch chuẩn so với trung bình.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Hướng dẫn bài tập
- Import
StandardScalertừ modulepreprocessingcủasklearn. - Khởi tạo
StandardScaler()và gán vàoSS_scaler. - Fit
StandardScalertrên cộtAgecủaso_numeric_df. - Transform cùng cột đó bằng scaler bạn vừa fit.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())