开始使用免费开始使用

预测应用的评分

在上一个练习中您已经探索了 Google 应用数据集,这一次我们来构建一个模型:根据部分特征来预测某个应用的评分。

为此,您将使用 scikit-learnDecisionTreeRegressor。决策树是许多集成模型的基础模块,回顾它们的工作方式将有助于您在整门课程中的学习。

我们将使用 MAE(平均绝对误差)作为评估指标。该指标非常容易解释,因为它表示实际评分与预测评分之间的平均绝对差值。

所需的模块都已为您预先导入。特征和目标变量分别存放在变量 Xy 中。

本练习是课程的一部分

Python 中的集成方法

查看课程

练习说明

  • 使用 train_test_split()Xy 划分为训练集和测试集。测试集比例设为 20%(即 0.2)。
  • 实例化一个 DecisionTreeRegressor()(命名为 reg_dt),并设置以下超参数:min_samples_leaf = 3min_samples_split = 9
  • 使用 .fit() 将回归器拟合到训练集。
  • 使用 .predict() 预测测试集的标签。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)

# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)

# Fit to the training set
____

# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))
编辑并运行代码