การปรับขนาดชุดข้อมูลฝึกสอน
ขนาดของชุดข้อมูลฝึกสอนและชุดข้อมูลทดสอบส่งผลต่อประสิทธิภาพของโมเดล โมเดลจะเรียนรู้ได้ดีขึ้นเมื่อมีข้อมูลฝึกสอนมากขึ้น อย่างไรก็ตาม มีความเสี่ยงที่โมเดลจะ overfit กับข้อมูลฝึกสอนจนไม่สามารถ generalize กับข้อมูลใหม่ได้ดี ดังนั้นเพื่อประเมินความสามารถในการ generalize ของโมเดลได้อย่างถูกต้อง จึงต้องมีข้อมูลทดสอบในปริมาณที่เพียงพอด้วย ผลลัพธ์คือต้องมีการสมดุลและแลกเปลี่ยนระหว่างสัดส่วนที่ใช้ฝึกสอนและสัดส่วนที่สำรองไว้ทดสอบ
จนถึงตอนนี้ใช้ข้อมูล 70% สำหรับฝึกสอนและ 30% สำหรับทดสอบ ต่อไปลองใช้ข้อมูล 80% สำหรับฝึกสอน แล้วดูว่าประสิทธิภาพของโมเดลเปลี่ยนแปลงอย่างไร
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Marketing Analytics: การพยากรณ์การเลิกใช้บริการของลูกค้าด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = ____