Bắt đầu ngayBắt đầu miễn phí

Chia Train/Test

Để tránh overfitting, trong Machine Learning người ta thường chia dữ liệu thành tập train và test. Cách làm này giúp đảm bảo mô hình có thể dự đoán đúng dữ liệu mới, chưa từng thấy.

Vì chúng ta đang làm việc với dữ liệu chuỗi thời gian, bạn không thể dùng phương pháp chia ngẫu nhiên, vì như vậy mô hình sẽ "biết trước tương lai".

Có sẵn một hàm để in ngày bắt đầu và kết thúc của một DataFrame là show_start_end(). Hàm này nhận một DataFrame làm đối số duy nhất và trả về một chuỗi.

Dữ liệu được cung cấp dưới tên environment.

Bài tập này là một phần của khóa học

Phân tích dữ liệu IoT bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Define the split day
limit_day = ____

# Split the data
train_env = ____[____]
test_env = ____[____]
Chỉnh sửa và Chạy Mã