Aan de slagBegin gratis

Train/Test-split

Om overfitting te voorkomen, is het in Machine Learning gebruikelijk om data op te splitsen in train- en test-gegevenssets. Dit zorgt ervoor dat het model nieuwe, onbekende data goed kan voorspellen.

Omdat we met tijdreeksdata werken, kunnen we geen willekeurige splitmethoden gebruiken, want dan zou het model de toekomst kunnen "zien".

Er is een functie beschikbaar om het begin en einde van een DataFrame te printen: show_start_end(). Deze neemt één DataFrame als argument en geeft een string terug.

De data is beschikbaar als environment.

Deze oefening maakt deel uit van de cursus

IoT-gegevens analyseren in Python

Bekijk cursus

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Define the split day
limit_day = ____

# Split the data
train_env = ____[____]
test_env = ____[____]
Code bewerken en uitvoeren