Rozdělení na trénovací a testovací sadu
Aby bylo možné objektivně vyhodnotit model strojového učení, je potřeba ho otestovat na nezávislé sadě dat. Nemůžeš použít stejná data, na kterých jsi model trénoval/a – na těch by přirozeně fungoval (relativně) dobře!
Data rozdělíš do dvou částí:
- trénovací data (slouží k trénování modelu) a
- testovací data (slouží k otestování modelu).
Poznámka: Od teď budeš pracovat s menší podmnožinou dat o letech, díky které budou cvičení běžet rychleji.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Náhodně rozděl data
flightsdo dvou sad v poměru 80:20. Pro zajištění opakovatelnosti nastav zárodek generátoru náhodných čísel na hodnotu 43. - Ověř, že trénovací sada obsahuje přibližně 80 % záznamů z původních dat.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)