CommencezCommencez gratuitement

Diviser les données

Maintenant que vous avez fait toutes vos manipulations, la dernière étape avant le modélisation est de diviser les données!

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Utilisez la méthode .randomSplit() du DataFrame pour scinder piped_data en deux ensembles : training avec 60 % des données et test avec 40 % des données, en passant la liste [.6, .4] à la méthode .randomSplit().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Split the data into training and test sets
training, test = piped_data.randomSplit(____)
Modifier et exécuter le code