Разбивка на обучающую и тестовую выборки
Чтобы избежать переобучения, в машинном обучении принято разделять данные на обучающую и тестовую выборки. Это позволяет убедиться, что модель способна корректно предсказывать новые, ранее не встречавшиеся данные.
Поскольку мы работаем с временными рядами, использовать случайное разбиение нельзя — иначе модель получит доступ к «будущим» данным.
Для вывода начала и конца DataFrame доступна функция show_start_end(), которая принимает DataFrame в качестве единственного аргумента и возвращает строку.
Данные доступны в переменной environment.
Это упражнение является частью курса
Анализ данных Интернета вещей на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]