ПочатиПочніть безкоштовно

Розбийте дані

Тепер, коли ви виконали всі перетворення, останній крок перед моделюванням — розбити дані!

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Інструкції до вправи

  • Скористайтеся методом датафрейму .randomSplit(), щоб розбити piped_data на дві частини: training із 60% даних та test із 40% даних, передавши список [.6, .4] до методу .randomSplit().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split the data into training and test sets
training, test = piped_data.randomSplit(____)
Редагувати та запускати код