Rozdělení dat
K dispozici máš dataframe df_examples se sloupci endword (řetězec), features (vektor), outvec (vektor) a label (celé číslo). Rozdělíš ho na trénovací a testovací sadu, které použiješ k natrénování a otestování klasifikátoru.
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Pokyny k cvičení
- Rozděl příklady na trénovací a testovací sadu v poměru 80/20.
- Vypiš počet trénovacích příkladů.
- Vypiš počet testovacích příkladů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)
# Print the number of training examples
print("Number training: ", ____.____)
# Print the number of test examples
print("Number test: ", ____.____)