以日期為基準的基線模型
我們已經建立了 3 個不同的基線模型。為了多練習,來再做幾個。第一個模型是基於分組變數。很明顯,車資可能會受到一天中不同時段的影響。例如,在尖峰時段價格可能較高。
你的目標是建立一個基線模型,依照對應的小時指派該時段的平均「fare_amount」。目前先針對整個 train 資料建立模型,並對 test 資料集進行預測。
train 和 test 這兩個 DataFrame 已可在你的工作環境中使用。而且,兩個 DataFrame 的「pickup_datetime」欄位都已為你轉換為 datetime 物件。
本練習屬於課程
用 Python 拿下 Kaggle 競賽
練習說明
- 從
train與test兩個 DataFrame 的「pickup_datetime」欄位取出 hour。 - 在訓練資料上計算每個小時的「fare_amount」平均值。
- 使用
pandas的map()方法,結合前述分組結果,對test做預測。 - 將預測結果寫入檔案。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)