แบ่งข้อมูลเป็นชุดฝึกและชุดทดสอบ
ตอนนี้พร้อมแล้วที่จะสร้างโมเดล machine learning แบบครบวงจรโดยทำตามขั้นตอนง่าย ๆ ไม่กี่ขั้นตอน! รายละเอียดเชิงลึกของการสร้างโมเดลจะได้เรียนในบทถัดไป แต่สำหรับตอนนี้ให้ฝึกทำความเข้าใจขั้นตอนหลักก่อน
ฟีเจอร์อิสระถูกโหลดให้แล้วในรูปแบบ DataFrame ของ pandas ชื่อ X และค่าที่ต้องการทำนายในรูปแบบ Series ของ pandas ชื่อ Y
นอกจากนี้ยังได้โหลดฟังก์ชัน train_test_split จากไลบรารี sklearn ไว้ให้แล้ว คราวนี้จะได้สร้างชุดข้อมูลฝึกและชุดข้อมูลทดสอบ พร้อมตรวจสอบว่าข้อมูลถูกแบ่งอย่างถูกต้อง
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning สำหรับการตลาดด้วย Python
คำแนะนำการฝึกหัด
- แบ่ง
XและYออกเป็นชุดฝึกและชุดทดสอบ โดยให้ข้อมูล 25% ถูกแบ่งไปเป็นชุดทดสอบ - ตรวจสอบว่าชุดข้อมูลฝึกมีข้อมูลเพียง 75% ของข้อมูลต้นฉบับ
- ตรวจสอบว่าชุดข้อมูลทดสอบมีข้อมูลเพียง 25% ของข้อมูลต้นฉบับ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])