CommencezCommencez gratuitement

Faire varier la taille de l'ensemble d'entraînement

La taille de vos ensembles d'entraînement et de test influence la performance du modèle. Les modèles apprennent mieux lorsqu'ils disposent de plus de données d'entraînement. Cependant, il existe un risque de surapprentissage sur les données d'entraînement, ce qui nuit à la capacité de généralisation sur de nouvelles données. Pour bien évaluer la capacité du modèle à généraliser, il vous faut donc suffisamment de données de test. Il y a donc un équilibre et un compromis importants à trouver entre la part utilisée pour l'entraînement et celle réservée au test.

Jusqu'ici, vous avez utilisé 70 % pour l'entraînement et 30 % pour le test. Utilisons maintenant 80 % des données pour l'entraînement et évaluons comment cela change la performance du modèle.

Cette activité fait partie du cours

Analytique marketing : prédire l'attrition de la clientèle avec Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import train_test_split
from sklearn.model_selection import train_test_split

# Create feature variable
X = telco.drop('Churn', axis=1)

# Create target variable
y = telco['Churn']

# Create training and testing sets
X_train, X_test, y_train, y_test = ____
Modifier et exécuter le code