เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแบ่งข้อมูล Train/Test

เพื่อหลีกเลี่ยงการ overfitting เป็นเรื่องปกติใน Machine Learning ที่จะแบ่งข้อมูลออกเป็นชุด train และชุด test วิธีนี้ช่วยให้แน่ใจว่าโมเดลสามารถทำนายข้อมูลใหม่ที่ยังไม่เคยเห็นได้อย่างถูกต้อง

เนื่องจากเรากำลังทำงานกับข้อมูล time-series จึงไม่สามารถใช้การแบ่งแบบสุ่มได้ เพราะจะทำให้โมเดลรู้ข้อมูลในอนาคต

ฟังก์ชัน show_start_end() พร้อมใช้งานแล้ว โดยรับ DataFrame เป็นอาร์กิวเมนต์และคืนค่าเป็น string ใช้สำหรับแสดงจุดเริ่มต้นและจุดสิ้นสุดของ DataFrame

ข้อมูลพร้อมใช้งานในตัวแปร environment

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์ข้อมูล IoT ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Define the split day
limit_day = ____

# Split the data
train_env = ____[____]
test_env = ____[____]
แก้ไขและรันโค้ด