Podziel dane
Dostępna jest ramka danych df_examples z kolumnami: endword (string), features (wektor), outvec (wektor) oraz label (int). Podzielisz ją na zbiór treningowy i testowy, których użyjesz do trenowania i oceny klasyfikatora.
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Instrukcje do ćwiczenia
- Podziel przykłady na zbiór treningowy i testowy w proporcji 80/20.
- Wyświetl liczbę przykładów treningowych.
- Wyświetl liczbę przykładów testowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)
# Print the number of training examples
print("Number training: ", ____.____)
# Print the number of test examples
print("Number test: ", ____.____)