Розділіть дані
Доступний датафрейм df_examples зі стовпцями endword: string, features: vector, outvec: vector та label: int. Ви розділите його, щоб отримати тренувальну та тестову вибірки, які ви використаєте для навчання і перевірки класифікатора.
Ця вправа є частиною курсу
Вступ до Spark SQL у Python
Інструкції до вправи
- Розділіть приклади на train і test у пропорції 80/20.
- Надрукуйте кількість тренувальних прикладів.
- Надрукуйте кількість тестових прикладів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)
# Print the number of training examples
print("Number training: ", ____.____)
# Print the number of test examples
print("Number test: ", ____.____)