การแบ่งข้อมูล Train/Test
เพื่อหลีกเลี่ยงการ overfitting เป็นเรื่องปกติใน Machine Learning ที่จะแบ่งข้อมูลออกเป็นชุด train และชุด test วิธีนี้ช่วยให้แน่ใจว่าโมเดลสามารถทำนายข้อมูลใหม่ที่ยังไม่เคยเห็นได้อย่างถูกต้อง
เนื่องจากเรากำลังทำงานกับข้อมูล time-series จึงไม่สามารถใช้การแบ่งแบบสุ่มได้ เพราะจะทำให้โมเดลรู้ข้อมูลในอนาคต
ฟังก์ชัน show_start_end() พร้อมใช้งานแล้ว โดยรับ DataFrame เป็นอาร์กิวเมนต์และคืนค่าเป็น string ใช้สำหรับแสดงจุดเริ่มต้นและจุดสิ้นสุดของ DataFrame
ข้อมูลพร้อมใช้งานในตัวแปร environment
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อมูล IoT ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]