包含类别特征的回归
现在,您已经创建了 music_dummies,其中为每首歌的流派生成了二元特征,是时候构建一个岭回归模型来预测歌曲的受欢迎度了。
music_dummies 已为您预加载,同时还包含 Ridge、cross_val_score、以 np 导入的 numpy,以及存储为 kf 的 KFold 对象。
我们将通过计算平均 RMSE 来评估模型。不过在此之前,您需要把每个折的得分转换为正值并取平方根。该指标表示模型预测的平均误差,因此可以与目标值 "popularity" 的标准差进行比较。
本练习是课程的一部分
使用 scikit-learn 的监督学习
练习说明
- 分别创建
X(包含music_dummies中的所有特征)和y(仅包含"popularity"列)。 - 实例化一个岭回归模型,将
alpha设为 0.2。 - 使用该岭回归模型在
X和y上执行交叉验证,将cv设为kf,并使用负均方误差作为评分指标。 - 通过将负的
scores转为正值并取平方根来打印 RMSE。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create X and y
X = ____
y = ____
# Instantiate a ridge model
ridge = ____
# Perform cross-validation
scores = ____(____, ____, ____, cv=____, scoring="____")
# Calculate RMSE
rmse = np.____(____)
print("Average RMSE: {}".format(np.mean(rmse)))
print("Standard Deviation of the target array: {}".format(np.std(y)))