การใช้ดัชนีจาก KFold
ได้สร้าง splits ไว้แล้ว ซึ่งเก็บดัชนีสำหรับชุดข้อมูล candy-data เพื่อทำ cross-validation แบบ 5-fold เพื่อประเมินประสิทธิภาพของโมเดล random forest ของเพื่อนร่วมงานบนข้อมูลชุดใหม่ได้แม่นยำยิ่งขึ้น จึงต้องรันโมเดลนี้บนดัชนีชุดฝึกและชุด validation ทั้ง 5 ชุดที่สร้างไว้
ในแบบฝึกหัดนี้ จะใช้ดัชนีเหล่านี้เพื่อตรวจสอบความแม่นยำของโมเดลในแต่ละ split โดยมี for loop เตรียมไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจสอบความถูกต้องของโมเดลใน Python
คำแนะนำการฝึกหัด
- ใช้
train_indexและval_indexเพื่อเลือกดัชนีที่ถูกต้องจากXและyสำหรับสร้างข้อมูลชุดฝึกและชุด validation - Fit
rfcโดยใช้ชุดข้อมูลฝึก - ใช้
rfcสร้างการทำนายบนชุดข้อมูล validation แล้วแสดงผลความแม่นยำของชุด validation
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error
rfc = RandomForestRegressor(n_estimators=25, random_state=1111)
# Access the training and validation indices of splits
for train_index, val_index in splits:
# Setup the training and validation data
X_train, y_train = X[____], y[____]
X_val, y_val = X[____], y[____]
# Fit the random forest model
rfc.____(____, ____)
# Make predictions, and print the accuracy
predictions = rfc.____(____)
print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))