开始使用免费开始使用

复现验证分数

您已经在视频中看到了验证集和公共排行榜的分数。不过,示例代码只针对测试数据。若要得到验证分数,您需要在留出集上重复相同的流程。

在本章中,您将使用 New York City Taxi 竞赛的数据。任务是预测纽约市一次出租车行程的车费金额。竞赛评估指标是均方根误差(root mean squared error)。

首要目标是在验证数据上评估基线模型。您将复现实用的最简单基线:使用 "fare_amount" 的均值。回顾一下,我们采用的验证策略是 30% 留出法,将 validation_train 作为训练集,将 validation_test 作为留出集 DataFrame。二者都已在您的工作区中提供。

本练习是课程的一部分

用 Python 赢下 Kaggle 竞赛

查看课程

练习说明

  • 计算整个 validation_train DataFrame 中 "fare_amount" 的均值。
  • 将该朴素预测值赋给所有留出集的预测,并存入 "pred" 列。

交互式实操练习

通过完成这段示例代码来试试这个练习。

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
编辑并运行代码