Împărțirea în set de antrenament și set de testare
Pentru a evalua obiectiv un model de învățare automată, trebuie să îl testezi pe un set de date independent. Nu poți folosi aceleași date cu care l-ai antrenat: evident, modelul va performa (relativ) bine pe datele pe care le-a văzut deja!
Vei împărți datele în două componente:
- date de antrenament (folosite pentru a antrena modelul) și
- date de testare (folosite pentru a testa modelul).
Notă: De acum înainte vei lucra cu un subset mai mic din datele despre zboruri, pentru ca exercițiile să ruleze mai rapid.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Împarte aleatoriu setul de date
flightsîn două seturi, cu proporțiile 80:20. Pentru reproductibilitate, setează seed-ul pentru numerele aleatoare la valoarea 43. - Verifică că setul de antrenament conține aproximativ 80% din înregistrările datelor originale.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)