CommencezCommencez gratuitement

Explorer le taux de désabonnement et scinder les données

En vous appuyant sur la vue d'ensemble présentée au chapitre 1, vous allez approfondir la préparation des données nécessaire pour utiliser le Machine Learning afin de prédire le désabonnement. Vous allez examiner la distribution du désabonnement et scinder les données en ensembles d'entraînement et de test avant de passer à la modélisation. Dans cette étape, vous comprenez comment se répartit le taux de désabonnement et vous prétraitez les données pour pouvoir construire un modèle sur l'ensemble d'entraînement et mesurer sa performance sur des données de test non utilisées.

L'ensemble de données de télécommunications a été chargé dans un DataFrame pandas nommé telcom. La colonne de la variable cible s'appelle Churn.

Cette activité fait partie du cours

Machine Learning pour le marketing en Python

Voir le cours

Instructions de l’exercice

  • Affichez les valeurs uniques de la colonne Churn.
  • Calculez la proportion de chaque groupe de désabonnement.
  • Importez la fonction permettant de scinder les données en entraînement et test.
  • Scindez les données en 75 % entraînement et 25 % test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Print the unique Churn values
print(___(telcom['Churn']))

# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100

# Import the function for splitting data to train and test
from sklearn.model_selection import ___

# Split the data into train and test
train, test = ___(telcom, test_size = .25)
Modifier et exécuter le code