Розбиття на тренувальну та тестову вибірки
Щоб уникнути перенавчання, у машинному навчанні зазвичай розбивають дані на тренувальний і тестовий набори. Це потрібно, щоб перевірити, чи здатна модель коректно передбачати нові, раніше не бачені дані.
Оскільки ми працюємо з часовими рядами, не можна використовувати випадкове розбиття, адже так модель «знатиме» майбутнє.
Доступна функція show_start_end(), яка виводить початок і кінець датафрейму. Вона приймає датафрейм як єдиний аргумент і повертає рядок.
Дані доступні як environment.
Ця вправа є частиною курсу
Аналіз даних IoT у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]