Bắt đầu ngayBắt đầu miễn phí

Chuẩn hóa (Standardization)

Mặc dù normalization (chuẩn hóa về khoảng) hữu ích để co giãn một cột vào giữa hai mốc giá trị, việc so sánh hai cột đã được scale trở nên khó khăn nếu chỉ một trong chúng bị ngoại lệ (outlier) ảnh hưởng quá mạnh. Một giải pháp thường dùng cho vấn đề này là standardization (chuẩn hóa theo phân phối), trong đó thay vì đặt cận trên và cận dưới cố định, bạn đưa dữ liệu về quanh giá trị trung bình của nó và tính xem mỗi điểm dữ liệu lệch bao nhiêu độ lệch chuẩn so với trung bình.

Bài tập này là một phần của khóa học

Feature Engineering cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import StandardScaler từ module preprocessing của sklearn.
  • Khởi tạo StandardScaler() và gán vào SS_scaler.
  • Fit StandardScaler trên cột Age của so_numeric_df.
  • Transform cùng cột đó bằng scaler bạn vừa fit.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
Chỉnh sửa và Chạy Mã