開始使用免費開始

以日期為基準的基線模型

我們已經建立了 3 個不同的基線模型。為了多練習,來再做幾個。第一個模型是基於分組變數。很明顯,車資可能會受到一天中不同時段的影響。例如,在尖峰時段價格可能較高。

你的目標是建立一個基線模型,依照對應的小時指派該時段的平均「fare_amount」。目前先針對整個 train 資料建立模型,並對 test 資料集進行預測。

traintest 這兩個 DataFrame 已可在你的工作環境中使用。而且,兩個 DataFrame 的「pickup_datetime」欄位都已為你轉換為 datetime 物件。

本練習屬於課程

用 Python 拿下 Kaggle 競賽

檢視課程

練習說明

  • traintest 兩個 DataFrame 的「pickup_datetime」欄位取出 hour。
  • 在訓練資料上計算每個小時的「fare_amount」平均值。
  • 使用 pandasmap() 方法,結合前述分組結果,對 test 做預測。
  • 將預測結果寫入檔案。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____

# Calculate average fare_amount grouped by pickup hour 
hour_groups = train.____('____')['____'].mean()

# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)

# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)
編輯並執行程式碼