Podział na zbiór treningowy i testowy
Aby uniknąć przeuczenia, w uczeniu maszynowym powszechną praktyką jest dzielenie danych na zbiór treningowy i testowy. Dzięki temu można sprawdzić, czy model poprawnie przewiduje nowe, niewidziane wcześniej dane.
Ponieważ pracujemy z danymi szeregów czasowych, nie możemy stosować losowego podziału – model mógłby w ten sposób „poznać przyszłość".
Dostępna jest funkcja show_start_end(), która wyświetla pierwszy i ostatni rekord ramki danych. Przyjmuje ramkę danych jako jedyny argument i zwraca ciąg znaków.
Dane są dostępne jako environment.
To ćwiczenie jest częścią kursu
Analiza danych IoT w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]