Biến đổi dữ liệu huấn luyện theo kiểu lười (lazily)
Tiền xử lý các biến đầu vào là bước rất quan trọng trong Machine Learning và thường giúp cải thiện độ chính xác của mô hình. Ở vài bài trước, dữ liệu Spotify đã được tiền xử lý sẵn cho bạn, nhưng điều quan trọng là bạn biết cách tự làm.
Trong bài này, bạn sẽ dùng đối tượng StandardScaler() để biến đổi các cột của một mảng sao cho chúng có trung bình bằng 0 và độ lệch chuẩn bằng 1.
Dask DataFrame chứa các bài hát Spotify đã có sẵn trong môi trường của bạn dưới tên dask_df. Nó bao gồm cả điểm phổ biến (target) và các biến đầu vào mà bạn dùng để dự đoán các điểm này.
Bài tập này là một phần của khóa học
Lập trình song song với Dask trong Python
Hướng dẫn bài tập
- Import lớp
StandardScaler()từdask_ml.preprocessing. - Chọn cột
'popularity'từ DataFrame và gán vào biếny. - Tạo một đối tượng
StandardScalervà fit nó với dữ liệuX. - Dùng scaler để biến đổi
X.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)