เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแบ่งข้อมูลพนักงาน

การ Overfit ชุดข้อมูลเป็นปัญหาที่พบบ่อยในงานวิเคราะห์ ซึ่งเกิดขึ้นเมื่อโมเดลทำงานได้ดีกับชุดข้อมูลที่ใช้พัฒนา แต่ไม่สามารถนำไปใช้งานกับข้อมูลอื่นได้

การแบ่งข้อมูลออกเป็นชุดฝึก (train) และชุดทดสอบ (test) ช่วยให้โมเดลสามารถ Generalize ได้ โดยใช้ชุดฝึกในการพัฒนาโมเดล แล้วนำชุดทดสอบมาตรวจสอบประสิทธิภาพในภายหลัง

ในแบบฝึกหัดนี้ จะแบ่งทั้ง target และ features ออกเป็นชุดฝึกและชุดทดสอบ ในอัตราส่วน 75%/25% ตามลำดับ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

HR Analytics: การพยากรณ์การลาออกของพนักงานด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import train_test_split จากโมดูล sklearn.model_selection
  • ใช้ train_test_split() เพื่อแบ่งชุดข้อมูลออกเป็นชุดฝึกและชุดทดสอบ
  • กำหนดให้ 25% ของข้อมูลเป็นชุดทดสอบ

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
แก้ไขและรันโค้ด