惰性地转换训练数据
在机器学习中,预处理输入变量至关重要,通常能提升您所建模型的准确性。前两个练习中已经为您预处理了 Spotify 数据,但掌握自己动手的流程同样重要。
在本练习中,您将使用 StandardScaler() 缩放器对象,将数组中的各列转换为均值为 0、标准差为 1。
环境中已提供包含 Spotify 歌曲的 Dask DataFrame,变量名为 dask_df。其中包含目标变量 popularity 分数,以及用于预测该分数的输入变量。
本练习是课程的一部分
Python 中的 Dask 并行编程
练习说明
- 从
dask_ml.preprocessing导入StandardScaler()类。 - 从 DataFrame 中选择
'popularity'列,并将其赋给变量y。 - 创建一个
StandardScaler对象,并将其拟合到X数据上。 - 使用该缩放器转换
X。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the StandardScaler class
from ____ import ____
X = dask_df[['duration_ms', 'explicit', 'danceability', 'acousticness', 'instrumentalness', 'tempo']]
# Select the target variable
y = ____
# Create a StandardScaler object and fit it on X
scaler = ____
scaler.____(____)
# Transform X
X = scaler.____
print(X)