ÎncepețiÎncepe gratuit

Împarte datele

Ai la dispoziție un DataFrame df_examples cu coloanele endword: string, features: vector, outvec: vector și label: int. Vei împărți acest DataFrame pentru a obține un set de antrenament și un set de testare, pe care le vei folosi pentru a antrena și evalua un clasificator.

Acest exercițiu face parte din cursul

Introducere în Spark SQL în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Împarte exemplele în seturi de antrenament și testare folosind un raport de 80/20.
  • Afișează numărul de exemple din setul de antrenament.
  • Afișează numărul de exemple din setul de testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)

# Print the number of training examples
print("Number training: ", ____.____)

# Print the number of test examples
print("Number test: ", ____.____)
Editează și rulează codul