ÎncepețiÎncepe gratuit

Împărțirea în set de antrenament/set de testare

Pentru a evita supraadaptarea (overfitting), în Machine Learning este o practică obișnuită să împarți datele în seturi de antrenament și de testare. Acest lucru asigură că modelul poate face predicții corecte pe date noi, nevăzute anterior.

Deoarece lucrăm cu date de tip serie temporală, nu putem folosi metode de împărțire aleatorie – altfel, modelul ar putea „cunoaște" viitorul.

O funcție pentru a afișa începutul și sfârșitul unui DataFrame este disponibilă sub numele show_start_end(). Aceasta primește un DataFrame ca unic argument și returnează un șir de caractere.

Datele sunt disponibile în variabila environment.

Acest exercițiu face parte din cursul

Analiza datelor IoT în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Define the split day
limit_day = ____

# Split the data
train_env = ____[____]
test_env = ____[____]
Editează și rulează codul