Začněte nyníZačněte zdarma

Rozdělení dat

K dispozici máš dataframe df_examples se sloupci endword (řetězec), features (vektor), outvec (vektor) a label (celé číslo). Rozdělíš ho na trénovací a testovací sadu, které použiješ k natrénování a otestování klasifikátoru.

Toto cvičení je součástí kurzu

Úvod do Spark SQL v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Rozděl příklady na trénovací a testovací sadu v poměru 80/20.
  • Vypiš počet trénovacích příkladů.
  • Vypiš počet testovacích příkladů.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)

# Print the number of training examples
print("Number training: ", ____.____)

# Print the number of test examples
print("Number test: ", ____.____)
Upravit a spustit kód