Zacznij terazZacznij za darmo

Zmiana rozmiaru zbioru treningowego

Rozmiar zbiorów treningowego i testowego ma wpływ na wydajność modelu. Modele uczą się lepiej, gdy mają więcej danych treningowych. Istnieje jednak ryzyko, że model przeuczy się na danych treningowych i słabo poradzi sobie z nowymi danymi – dlatego do prawidłowej oceny zdolności modelu do generalizacji potrzebujesz wystarczającej ilości danych testowych. W efekcie kluczowe jest zachowanie właściwej równowagi między tym, ile danych przeznaczasz na trening, a ile zatrzymujesz do testowania.

Do tej pory korzystałeś z podziału 70% na trening i 30% na testowanie. Teraz użyjemy 80% danych do treningu i sprawdzimy, jak to wpłynie na wydajność modelu.

To ćwiczenie jest częścią kursu

Marketing Analytics: Przewidywanie rezygnacji klientów w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import train_test_split
from sklearn.model_selection import train_test_split

# Create feature variable
X = telco.drop('Churn', axis=1)

# Create target variable
y = telco['Churn']

# Create training and testing sets
X_train, X_test, y_train, y_test = ____
Edytuj i uruchom kod