预测应用的评分
在上一个练习中您已经探索了 Google 应用数据集,这一次我们来构建一个模型:根据部分特征来预测某个应用的评分。
为此,您将使用 scikit-learn 的 DecisionTreeRegressor。决策树是许多集成模型的基础模块,回顾它们的工作方式将有助于您在整门课程中的学习。
我们将使用 MAE(平均绝对误差)作为评估指标。该指标非常容易解释,因为它表示实际评分与预测评分之间的平均绝对差值。
所需的模块都已为您预先导入。特征和目标变量分别存放在变量 X 和 y 中。
本练习是课程的一部分
Python 中的集成方法
练习说明
- 使用
train_test_split()将X和y划分为训练集和测试集。测试集比例设为 20%(即0.2)。 - 实例化一个
DecisionTreeRegressor()(命名为reg_dt),并设置以下超参数:min_samples_leaf = 3和min_samples_split = 9。 - 使用
.fit()将回归器拟合到训练集。 - 使用
.predict()预测测试集的标签。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)
# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)
# Fit to the training set
____
# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))