НачатьНачать бесплатно

Разбиение данных

Доступен датафрейм df_examples со столбцами: endword (строка), features (вектор), outvec (вектор) и label (целое число). Вам нужно разбить его на обучающую и тестовую выборки, которые затем будут использоваться для обучения и оценки классификатора.

Это упражнение является частью курса

Введение в Spark SQL на Python

Посмотреть курс

Инструкции к упражнению

  • Разбейте примеры на обучающую и тестовую выборки в соотношении 80/20.
  • Выведите количество примеров в обучающей выборке.
  • Выведите количество примеров в тестовой выборке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)

# Print the number of training examples
print("Number training: ", ____.____)

# Print the number of test examples
print("Number test: ", ____.____)
Редактировать и запускать код