Zbiór testowy a treningowy
Po wyczyszczeniu danych i przygotowaniu ich do modelowania jednym z najważniejszych kroków jest podział zbioru na zbiór testowy i zbiór treningowy. Po tym podziale nie dotykaj danych testowych, dopóki nie uznasz, że masz dobry model! Podczas budowania modeli i formułowania hipotez możesz sprawdzać je na danych treningowych, żeby ocenić ich skuteczność.
Gdy wybierzesz swój najlepszy model, możesz sprawdzić, jak dobrze radzi sobie z przewidywaniem nowych danych ze zbioru testowego. Te dane – niewidziane wcześniej przez model – dają znacznie bardziej realistyczny obraz jego rzeczywistej skuteczności przy przewidywaniu lub klasyfikowaniu nowych przypadków.
W Sparku ważne jest, aby podzielić dane po wykonaniu wszystkich przekształceń. Dzieje się tak dlatego, że operacje takie jak StringIndexer nie zawsze generują te same indeksy nawet dla tej samej listy ciągów znaków.
Dlaczego używanie zbioru testowego jest ważne przy ocenie modelu?
To ćwiczenie jest częścią kursu
Podstawy PySpark
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie