Разбиение данных
Доступен датафрейм df_examples со столбцами: endword (строка), features (вектор), outvec (вектор) и label (целое число). Вам нужно разбить его на обучающую и тестовую выборки, которые затем будут использоваться для обучения и оценки классификатора.
Это упражнение является частью курса
Введение в Spark SQL на Python
Инструкции к упражнению
- Разбейте примеры на обучающую и тестовую выборки в соотношении 80/20.
- Выведите количество примеров в обучающей выборке.
- Выведите количество примеров в тестовой выборке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)
# Print the number of training examples
print("Number training: ", ____.____)
# Print the number of test examples
print("Number test: ", ____.____)