Découpage entraînement/test
Pour éviter le surapprentissage, il est courant en Machine Learning de diviser les données en ensembles d'entraînement et de test. On fait cela pour s'assurer que le modèle peut prédire correctement de nouvelles données jamais vues.
Comme nous travaillons avec des séries chronologiques, nous ne pouvons pas utiliser de méthodes de découpage aléatoires, car cela permettrait au modèle de « connaître » le futur.
Une fonction pour afficher le début et la fin d'un DataFrame est offerte sous le nom show_start_end(). Elle prend un DataFrame comme seul argument et retourne une chaîne de caractères.
Les données sont disponibles sous environment.
Cette activité fait partie du cours
Analyse de données IoT avec Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]