ПочатиПочніть безкоштовно

Розділіть дані

Доступний датафрейм df_examples зі стовпцями endword: string, features: vector, outvec: vector та label: int. Ви розділите його, щоб отримати тренувальну та тестову вибірки, які ви використаєте для навчання і перевірки класифікатора.

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Інструкції до вправи

  • Розділіть приклади на train і test у пропорції 80/20.
  • Надрукуйте кількість тренувальних прикладів.
  • Надрукуйте кількість тестових прикладів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split the examples into train and test, use 80/20 split
df_trainset, df_testset = df_examples.____((____), 42)

# Print the number of training examples
print("Number training: ", ____.____)

# Print the number of test examples
print("Number test: ", ____.____)
Редагувати та запускати код