Împarte datele
Ai la dispoziție un DataFrame df_examples cu coloanele endword: string, features: vector, outvec: vector și label: int. Vei împărți acest DataFrame pentru a obține un set de antrenament și un set de testare, pe care le vei folosi pentru a antrena și evalua un clasificator.
Acest exercițiu face parte din cursul
Introducere în Spark SQL în Python
Instrucțiuni pentru exercițiu
- Împarte exemplele în seturi de antrenament și testare folosind un raport de 80/20.
- Afișează numărul de exemple din setul de antrenament.
- Afișează numărul de exemple din setul de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)
# Print the number of training examples
print("Number training: ", ____.____)
# Print the number of test examples
print("Number test: ", ____.____)