開始使用免費開始

欠擬合/過擬合造成的誤差

這個糖果資料集非常容易過擬合。只有 85 筆觀測值,如果你把 20% 拿去當測試集,就會損失許多可用來建模的重要資料。想像一個情況:大多數巧克力糖果都落在訓練集中,而保留樣本裡只有少數。模型可能「只」看到巧克力這個因素很關鍵,卻找不到其他屬性也很重要。在這個練習中,你將探索在隨機森林模型中使用太多特徵(欄)如何導致過擬合。

「特徵(feature)」代表在決策樹中會使用到哪些資料欄位。參數 max_features 用來限制可用的特徵數量。

本練習屬於課程

Python 的模型驗證

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
編輯並執行程式碼