Zacznij terazZacznij za darmo

Podział na zbiór treningowy i testowy

Aby uniknąć przeuczenia, w uczeniu maszynowym powszechną praktyką jest dzielenie danych na zbiór treningowy i testowy. Dzięki temu można sprawdzić, czy model poprawnie przewiduje nowe, niewidziane wcześniej dane.

Ponieważ pracujemy z danymi szeregów czasowych, nie możemy stosować losowego podziału – model mógłby w ten sposób „poznać przyszłość".

Dostępna jest funkcja show_start_end(), która wyświetla pierwszy i ostatni rekord ramki danych. Przyjmuje ramkę danych jako jedyny argument i zwraca ciąg znaków.

Dane są dostępne jako environment.

To ćwiczenie jest częścią kursu

Analiza danych IoT w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Define the split day
limit_day = ____

# Split the data
train_env = ____[____]
test_env = ____[____]
Edytuj i uruchom kod