开始使用免费开始使用

基于日期的基线模型

我们已经构建了 3 个不同的基线模型。为进一步练习,让我们再做几个。第一个模型基于分组变量。很明显,乘车费用可能取决于一天中的时间段。例如,高峰时段价格可能更高。

您的目标是构建一个基线模型,为相应小时分配该小时的平均 "fare_amount"。目前,您将基于整个 train 数据创建模型,并对 test 数据集进行预测。

traintest 两个 DataFrame 已在您的工作区中可用。此外,两个 DataFrame 中的 "pickup_datetime" 列已经为您转换为 datetime 对象。

本练习是课程的一部分

用 Python 赢下 Kaggle 竞赛

查看课程

练习说明

  • traintest 的 "pickup_datetime" 列中提取小时。
  • 在训练数据上按小时计算 "fare_amount" 的均值。
  • 使用 pandasmap() 方法和获得的分组,在 test 上生成预测。
  • 将预测写入文件。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____

# Calculate average fare_amount grouped by pickup hour 
hour_groups = train.____('____')['____'].mean()

# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)

# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)
编辑并运行代码