Začněte nyníZačněte zdarma

Rozdělení na trénovací a testovací sadu

Aby bylo možné objektivně vyhodnotit model strojového učení, je potřeba ho otestovat na nezávislé sadě dat. Nemůžeš použít stejná data, na kterých jsi model trénoval/a – na těch by přirozeně fungoval (relativně) dobře!

Data rozdělíš do dvou částí:

  • trénovací data (slouží k trénování modelu) a
  • testovací data (slouží k otestování modelu).

Poznámka: Od teď budeš pracovat s menší podmnožinou dat o letech, díky které budou cvičení běžet rychleji.

Toto cvičení je součástí kurzu

Machine Learning with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Náhodně rozděl data flights do dvou sad v poměru 80:20. Pro zajištění opakovatelnosti nastav zárodek generátoru náhodných čísel na hodnotu 43.
  • Ověř, že trénovací sada obsahuje přibližně 80 % záznamů z původních dat.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)

# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)
Upravit a spustit kód