Rozdělení na trénovací a testovací sadu
Aby se předešlo přetrénování modelu, je v Machine Learning běžnou praxí rozdělit data na trénovací a testovací sadu. Tím zajistíme, že model dokáže správně předpovídat nová, dosud neviděná data.
Protože pracujeme s časovými řadami, nemůžeme použít náhodné dělení – model by tak mohl „vidět do budoucnosti".
K dispozici máš funkci show_start_end(), která vytiskne začátek a konec DataFrame. Přijímá DataFrame jako jediný argument a vrací řetězec.
Data jsou dostupná jako environment.
Toto cvičení je součástí kurzu
Analýza dat z IoT v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define the split day
limit_day = ____
# Split the data
train_env = ____[____]
test_env = ____[____]