Kom igångKom igång gratis

Tränings- och testuppdelning

För att objektivt utvärdera en maskininlärningsmodell behöver du testa den på ett oberoende dataset. Du kan inte använda samma data som du tränade modellen på – det är självklart att modellen presterar (relativt) bra på just de data!

Du delar upp data i två delar:

  • träningsdata (används för att träna modellen) och
  • testdata (används för att utvärdera modellen).

Obs: Från och med nu arbetar du med en mindre delmängd av flygdata, vilket gör att övningarna går snabbare att köra.

Den här övningen är en del av kursen

Maskininlärning med PySpark

Visa kurs

Övningsinstruktioner

  • Dela upp datamängden flights slumpmässigt i två delar med proportionen 80:20. Ange slumptalet 43 som frö för att kunna reproducera resultatet.
  • Kontrollera att träningsdata innehåller ungefär 80 % av raderna från den ursprungliga datamängden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)

# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)
Redigera och kör kod