Podział na zbiór treningowy i testowy
Aby obiektywnie ocenić model uczenia maszynowego, musisz przetestować go na niezależnym zbiorze danych. Nie możesz używać tych samych danych, których użyto do trenowania modelu – siłą rzeczy wypadłby na nich dobrze!
Podzielisz dane na dwie części:
- dane treningowe (służące do trenowania modelu) oraz
- dane testowe (służące do oceny modelu).
Uwaga: Od tego momentu będziesz pracować z mniejszym podzbiorem danych o lotach, co przyspieszy wykonywanie ćwiczeń.
To ćwiczenie jest częścią kursu
Uczenie maszynowe z PySpark
Instrukcje do ćwiczenia
- Losowo podziel dane
flightsna dwa zbiory w proporcji 80:20. Aby zapewnić powtarzalność wyników, ustaw ziarno generatora liczb losowych na 43. - Sprawdź, czy zbiór treningowy zawiera około 80% rekordów z oryginalnych danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)