เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การปรับขนาดชุดข้อมูลฝึกสอน

ขนาดของชุดข้อมูลฝึกสอนและชุดข้อมูลทดสอบส่งผลต่อประสิทธิภาพของโมเดล โมเดลจะเรียนรู้ได้ดีขึ้นเมื่อมีข้อมูลฝึกสอนมากขึ้น อย่างไรก็ตาม มีความเสี่ยงที่โมเดลจะ overfit กับข้อมูลฝึกสอนจนไม่สามารถ generalize กับข้อมูลใหม่ได้ดี ดังนั้นเพื่อประเมินความสามารถในการ generalize ของโมเดลได้อย่างถูกต้อง จึงต้องมีข้อมูลทดสอบในปริมาณที่เพียงพอด้วย ผลลัพธ์คือต้องมีการสมดุลและแลกเปลี่ยนระหว่างสัดส่วนที่ใช้ฝึกสอนและสัดส่วนที่สำรองไว้ทดสอบ

จนถึงตอนนี้ใช้ข้อมูล 70% สำหรับฝึกสอนและ 30% สำหรับทดสอบ ต่อไปลองใช้ข้อมูล 80% สำหรับฝึกสอน แล้วดูว่าประสิทธิภาพของโมเดลเปลี่ยนแปลงอย่างไร

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Marketing Analytics: การพยากรณ์การเลิกใช้บริการของลูกค้าด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import train_test_split
from sklearn.model_selection import train_test_split

# Create feature variable
X = telco.drop('Churn', axis=1)

# Create target variable
y = telco['Churn']

# Create training and testing sets
X_train, X_test, y_train, y_test = ____
แก้ไขและรันโค้ด