เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

แบ่งข้อมูลเป็นชุดฝึกและชุดทดสอบ

ตอนนี้พร้อมแล้วที่จะสร้างโมเดล machine learning แบบครบวงจรโดยทำตามขั้นตอนง่าย ๆ ไม่กี่ขั้นตอน! รายละเอียดเชิงลึกของการสร้างโมเดลจะได้เรียนในบทถัดไป แต่สำหรับตอนนี้ให้ฝึกทำความเข้าใจขั้นตอนหลักก่อน

ฟีเจอร์อิสระถูกโหลดให้แล้วในรูปแบบ DataFrame ของ pandas ชื่อ X และค่าที่ต้องการทำนายในรูปแบบ Series ของ pandas ชื่อ Y

นอกจากนี้ยังได้โหลดฟังก์ชัน train_test_split จากไลบรารี sklearn ไว้ให้แล้ว คราวนี้จะได้สร้างชุดข้อมูลฝึกและชุดข้อมูลทดสอบ พร้อมตรวจสอบว่าข้อมูลถูกแบ่งอย่างถูกต้อง

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning สำหรับการตลาดด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แบ่ง X และ Y ออกเป็นชุดฝึกและชุดทดสอบ โดยให้ข้อมูล 25% ถูกแบ่งไปเป็นชุดทดสอบ
  • ตรวจสอบว่าชุดข้อมูลฝึกมีข้อมูลเพียง 75% ของข้อมูลต้นฉบับ
  • ตรวจสอบว่าชุดข้อมูลทดสอบมีข้อมูลเพียง 25% ของข้อมูลต้นฉบับ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)

# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])

# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])
แก้ไขและรันโค้ด