Diviser les données
Maintenant que vous avez effectué toutes vos manipulations, la dernière étape avant la modélisation consiste à diviser les données.
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
- Utilisez la méthode DataFrame
.randomSplit()pour diviserpiped_dataen deux parties,trainingcontenant 60 % des données ettestcontenant 40 % des données, en transmettant la liste[.6, .4]à la méthode.randomSplit().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Split the data into training and test sets
training, test = piped_data.randomSplit(____)