KFold cross validation
ในการทำงานกับโมเดล ML การประเมินประสิทธิภาพบนข้อมูลที่โมเดลไม่เคยเห็นมาก่อนถือเป็นสิ่งสำคัญ เทคนิคที่นิยมใช้สำหรับจุดประสงค์นี้คือ k-fold cross-validation ในแบบฝึกหัดนี้ จะได้สำรวจวิธีที่เทคนิค k-fold cross-validation แบ่งชุดข้อมูลออกเป็นชุดฝึกและชุดทดสอบ โดย KFold และฟีเจอร์ของชุดข้อมูลโรคหัวใจ heart_disease_df_X ถูก import ไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning แบบ End-to-End
คำแนะนำการฝึกหัด
- สร้างออบเจกต์ KFold โดยกำหนด
n_splits=5,shuffle=Trueและrandom_state=42 - แบ่งข้อมูลโดยใช้
kfold.split() - แสดงจำนวน datapoint ในส่วน train และ test ที่แบ่งได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a KFold object
kfold = ____(____, ____, ____)
# Get the train and test data from the first split from the shuffled KFold
train_data_split, test_data_split = next(____.____(____))
# Print out the number of datapoints in the train and test splits
print("Number of training datapoints in heart_disease_df_X:", ____)
print("Number of training datapoints in split:", ____)
print("Number of testing datapoints in split:", ____)