Diviser les données en ensembles d'entraînement et de test
Vous êtes maintenant prêt à créer un modèle de Machine Learning de bout en bout en suivant quelques étapes simples! Vous explorerez les nuances de la modélisation plus en détail dans les prochains chapitres, mais pour l'instant vous allez pratiquer et comprendre les étapes clés.
Les variables indépendantes ont été chargées pour vous dans un DataFrame pandas nommé X, et les valeurs dépendantes dans une Series pandas nommée Y.
De plus, la fonction train_test_split a été importée de la bibliothèque sklearn. Vous allez maintenant créer les ensembles d'entraînement et de test, puis vérifier que la division des données est correcte.
Cette activité fait partie du cours
Machine Learning pour le marketing en Python
Instructions de l’exercice
- Divisez
XetYen ensembles d'entraînement et de test en réservant 25 % des données pour le test. - Assurez-vous que l'ensemble d'entraînement contient seulement 75 % des données originales.
- Assurez-vous que l'ensemble de test contient seulement 25 % des données originales.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])