การเทรนด้วย Bootstrapping
มาสร้างตัวจำแนกประเภท decision tree แบบ "weak" และเทรนบนตัวอย่างที่สุ่มมาจากชุด train แบบเติมกลับ กัน การทำเช่นนี้จะช่วยให้เข้าใจว่าเกิดอะไรขึ้นในแต่ละรอบของ bagging ensemble
ในการสุ่มตัวอย่าง ให้ใช้เมธอด .sample() ของ pandas ซึ่งมีพารามิเตอร์ replace โดยโค้ดด้านล่างนี้เป็นตัวอย่างการสุ่ม แบบเติมกลับ จาก DataFrame df ทั้งหมด:
df.sample(frac=1.0, replace=True, random_state=42)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Ensemble Methods ใน Python
คำแนะนำการฝึกหัด
- สุ่มตัวอย่างแบบเติมกลับ (
replace=True) จากชุด train ทั้งหมด (frac=1.0) นั่นคือX_train - สร้างตัวจำแนกประเภท decision tree โดยใช้พารามิเตอร์
max_depth = 4 - Fit โมเดลกับข้อมูล train ที่สุ่มมา
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Take a sample with replacement
X_train_sample = X_train.____(____, ____, random_state=42)
y_train_sample = y_train.loc[X_train_sample.index]
# Build a "weak" Decision Tree classifier
clf = ____(____, random_state=500)
# Fit the model to the training sample
____