Train/Test-split
Om overfitting te voorkomen, is het in Machine Learning gebruikelijk om data op te splitsen in train- en test-gegevenssets. Dit zorgt ervoor dat het model nieuwe, onbekende data goed kan voorspellen.
Omdat we met tijdreeksdata werken, kunnen we geen willekeurige splitmethoden gebruiken, want dan zou het model de toekomst kunnen "zien".
Er is een functie beschikbaar om het begin en einde van een DataFrame te printen: show_start_end(). Deze neemt één DataFrame als argument en geeft een string terug.
De data is beschikbaar als environment.
Deze oefening maakt deel uit van de cursus
IoT-gegevens analyseren in Python
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]