Prédire le churn avec un arbre de décision
Vous allez maintenant miser sur les compétences acquises dans l'exercice précédent et construire un arbre de décision plus complexe, avec des paramètres supplémentaires, pour prédire le churn des clients. Vous approfondirez ce problème de prédiction du churn au prochain chapitre. Ici, vous allez exécuter de nouveau le classificateur d'arbre de décision sur vos données d'entraînement, prédire le taux de churn sur des données non vues (test) et évaluer la justesse du modèle sur les deux jeux de données.
Le module tree de la bibliothèque sklearn a été chargé pour vous, ainsi que la fonction accuracy_score de sklearn.metrics. Les variables de caractéristiques et la cible ont aussi été importées sous les noms train_X, train_Y pour les données d'entraînement, et test_X, test_Y pour les données de test.
Cette activité fait partie du cours
Machine Learning pour le marketing en Python
Instructions de l’exercice
- Initialisez un arbre de décision avec une profondeur maximale de 7 et en utilisant le critère gini.
- Ajustez le modèle aux données d'entraînement.
- Prédisez les valeurs sur le jeu de données de test.
- Affichez les valeurs de justesse pour les jeux de données d'entraînement et de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Initialize the Decision Tree
clf = tree.DecisionTreeClassifier(max_depth = ___,
criterion = 'gini',
splitter = 'best')
# Fit the model to the training data
clf = clf.___(train_X, train_Y)
# Predict the values on test dataset
pred_Y = clf.___(test_X)
# Print accuracy values
print("Training accuracy: ", np.round(clf.score(train_X, train_Y), 3))
print("Test accuracy: ", np.round(___(test_Y, pred_Y), 3))