Chuẩn hóa dữ liệu (Scaling)
Với các thuật toán ML dựa trên khoảng cách, bạn luôn phải chuẩn hóa dữ liệu, vì các đặc trưng trên những thang đo khác nhau sẽ làm sai lệch kết quả. K-means dùng khoảng cách Euclid để đo khoảng cách tới tâm cụm, nên trước hết bạn cần chuẩn hóa dữ liệu rồi mới tiếp tục triển khai thuật toán. Hãy làm bước đó trước.
Đã có sẵn dataframe df từ bài trước, với một số chuẩn bị nhỏ để sẵn sàng dùng với sklearn. Nhãn gian lận được lưu riêng trong labels, bạn có thể dùng để kiểm tra kết quả sau. numpy đã được import với bí danh np.
Bài tập này là một phần của khóa học
Phát hiện gian lận với Python
Hướng dẫn bài tập
- Import
MinMaxScaler. - Chuyển dataframe
dfthành một mảng numpyXbằng cách chỉ lấy các giá trị củadfvà đảm bảo tất cả đều là kiểufloat. - Áp dụng scaler đã định nghĩa lên
Xđể thu được các giá trị đã chuẩn hóaX_scaled, đưa mọi đặc trưng về thang 0-1.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)