Diviser les données en entraînement et test
Dernière étape avant de passer à la construction du modèle de régression! Ici, vous allez identifier les noms de la variable cible et des colonnes de caractéristiques, extraire les données, puis les diviser en ensembles d'entraînement et de test.
Les bibliothèques pandas et numpy ont été chargées sous pd et np respectivement. Les caractéristiques d'entrée sont importées dans l'ensemble de données features, et la variable cible que vous avez créée à l'exercice précédent a été importée pour vous sous le nom Y.
Cette activité fait partie du cours
Machine Learning pour le marketing en Python
Instructions de l’exercice
- Enregistrez le nom de la colonne identifiant le client sous forme de liste.
- Sélectionnez les noms des colonnes de caractéristiques en excluant l'identifiant du client.
- Extrayez les caractéristiques dans
X. - Divisez les données en entraînement et test avec la fonction
train_test_split().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)