Tränings- och testuppdelning
För att objektivt utvärdera en maskininlärningsmodell behöver du testa den på ett oberoende dataset. Du kan inte använda samma data som du tränade modellen på – det är självklart att modellen presterar (relativt) bra på just de data!
Du delar upp data i två delar:
- träningsdata (används för att träna modellen) och
- testdata (används för att utvärdera modellen).
Obs: Från och med nu arbetar du med en mindre delmängd av flygdata, vilket gör att övningarna går snabbare att köra.
Den här övningen är en del av kursen
Maskininlärning med PySpark
Övningsinstruktioner
- Dela upp datamängden
flightsslumpmässigt i två delar med proportionen 80:20. Ange slumptalet 43 som frö för att kunna reproducera resultatet. - Kontrollera att träningsdata innehåller ungefär 80 % av raderna från den ursprungliga datamängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)