Zacznij terazZacznij za darmo

Podział na zbiór treningowy i testowy

Aby obiektywnie ocenić model uczenia maszynowego, musisz przetestować go na niezależnym zbiorze danych. Nie możesz używać tych samych danych, których użyto do trenowania modelu – siłą rzeczy wypadłby na nich dobrze!

Podzielisz dane na dwie części:

  • dane treningowe (służące do trenowania modelu) oraz
  • dane testowe (służące do oceny modelu).

Uwaga: Od tego momentu będziesz pracować z mniejszym podzbiorem danych o lotach, co przyspieszy wykonywanie ćwiczeń.

To ćwiczenie jest częścią kursu

Uczenie maszynowe z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Losowo podziel dane flights na dwa zbiory w proporcji 80:20. Aby zapewnić powtarzalność wyników, ustaw ziarno generatora liczb losowych na 43.
  • Sprawdź, czy zbiór treningowy zawiera około 80% rekordów z oryginalnych danych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)

# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)
Edytuj i uruchom kod