Împărțirea în set de antrenament/set de testare
Pentru a evita supraadaptarea (overfitting), în Machine Learning este o practică obișnuită să împarți datele în seturi de antrenament și de testare. Acest lucru asigură că modelul poate face predicții corecte pe date noi, nevăzute anterior.
Deoarece lucrăm cu date de tip serie temporală, nu putem folosi metode de împărțire aleatorie – altfel, modelul ar putea „cunoaște" viitorul.
O funcție pentru a afișa începutul și sfârșitul unui DataFrame este disponibilă sub numele show_start_end(). Aceasta primește un DataFrame ca unic argument și returnează un șir de caractere.
Datele sunt disponibile în variabila environment.
Acest exercițiu face parte din cursul
Analiza datelor IoT în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]