基于日期的基线模型
我们已经构建了 3 个不同的基线模型。为进一步练习,让我们再做几个。第一个模型基于分组变量。很明显,乘车费用可能取决于一天中的时间段。例如,高峰时段价格可能更高。
您的目标是构建一个基线模型,为相应小时分配该小时的平均 "fare_amount"。目前,您将基于整个 train 数据创建模型,并对 test 数据集进行预测。
train 和 test 两个 DataFrame 已在您的工作区中可用。此外,两个 DataFrame 中的 "pickup_datetime" 列已经为您转换为 datetime 对象。
本练习是课程的一部分
用 Python 赢下 Kaggle 竞赛
练习说明
- 从
train和test的 "pickup_datetime" 列中提取小时。 - 在训练数据上按小时计算 "fare_amount" 的均值。
- 使用
pandas的map()方法和获得的分组,在test上生成预测。 - 将预测写入文件。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)