Variierende Trainingsdatensatzgröße
Die Größe deiner Trainings- und Testsets beeinflusst die Modellleistung. Modelle lernen besser, wenn sie mehr Trainingsdaten haben. Allerdings besteht die Gefahr, dass sie das Training überanpassen und sich nicht gut auf neue Daten verallgemeinern. Um die Generalisierungsfähigkeit korrekt zu bewerten, brauchst du daher ausreichend Testdaten. Es gibt also ein wichtiges Gleichgewicht bzw. einen Trade-off zwischen dem Anteil für das Training und dem Anteil, den du fürs Testen zurückhältst.
Bisher hast du 70 % zum Trainieren und 30 % zum Testen verwendet. Lass uns jetzt 80 % der Daten zum Trainieren nutzen und auswerten, wie sich dadurch die Leistung des Modells verändert.
Diese Übung ist Teil des Kurses
<Kurs>Marketing Analytics: Kundenabwanderung in Python vorhersagen</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = ____