เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ข้อผิดพลาดจาก under/over-fitting

ชุดข้อมูลขนมมีแนวโน้มที่จะเกิด overfitting ได้ง่าย เนื่องจากมีเพียง 85 รายการ หากใช้ 20% สำหรับชุดข้อมูลทดสอบ ก็จะสูญเสียข้อมูลจำนวนมากที่มีประโยชน์ต่อการสร้างโมเดล ลองนึกภาพว่าขนมช็อกโกแลตส่วนใหญ่ถูกแบ่งไปอยู่ในชุดข้อมูล training และมีเพียงไม่กี่รายการในชุด holdout โมเดลอาจมองเห็นแค่ว่าช็อกโกแลตเป็นปัจจัยสำคัญ แต่ไม่สามารถตรวจพบได้ว่าคุณลักษณะอื่นๆ ก็มีความสำคัญเช่นกัน ในแบบฝึกหัดนี้ จะมีการสำรวจว่าการใช้ฟีเจอร์ (คอลัมน์) มากเกินไปในโมเดล random forest อาจนำไปสู่ overfitting ได้อย่างไร

ฟีเจอร์ หมายถึงคอลัมน์ของข้อมูลที่นำมาใช้ใน decision tree พารามิเตอร์ max_features ใช้จำกัดจำนวนฟีเจอร์ที่สามารถใช้ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การตรวจสอบความถูกต้องของโมเดลใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Update the rfr model
rfr = RandomForestRegressor(____=25,
                            ____=1111,
                            ____=2)
rfr.fit(X_train, y_train)

# Print the training and testing accuracies 
print('The training error is {0:.2f}'.format(
  mae(y_train, rfr.predict(X_train))))
print('The testing error is {0:.2f}'.format(
  mae(y_test, rfr.predict(X_test))))
แก้ไขและรันโค้ด