CommencezCommencez gratuitement

Diviser les données en ensembles d'entraînement et de test

Vous êtes maintenant prêt à créer un modèle de Machine Learning de bout en bout en suivant quelques étapes simples! Vous explorerez les nuances de la modélisation plus en détail dans les prochains chapitres, mais pour l'instant vous allez pratiquer et comprendre les étapes clés.

Les variables indépendantes ont été chargées pour vous dans un DataFrame pandas nommé X, et les valeurs dépendantes dans une Series pandas nommée Y.

De plus, la fonction train_test_split a été importée de la bibliothèque sklearn. Vous allez maintenant créer les ensembles d'entraînement et de test, puis vérifier que la division des données est correcte.

Cette activité fait partie du cours

Machine Learning pour le marketing en Python

Voir le cours

Instructions de l’exercice

  • Divisez X et Y en ensembles d'entraînement et de test en réservant 25 % des données pour le test.
  • Assurez-vous que l'ensemble d'entraînement contient seulement 75 % des données originales.
  • Assurez-vous que l'ensemble de test contient seulement 25 % des données originales.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)

# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])

# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])
Modifier et exécuter le code