Různé velikosti trénovací sady
Velikost trénovací a testovací sady ovlivňuje výkon modelu. Modely se učí lépe, když mají k dispozici více trénovacích dat. Hrozí ale riziko přetrénování (overfittingu) – model si data „zapamatuje" místo toho, aby se naučil obecné vzory, a pak si nevede dobře na nových datech. Proto je potřeba mít dostatek testovacích dat pro správné vyhodnocení schopnosti modelu zobecňovat. Výsledkem je důležitý kompromis mezi tím, kolik dat použiješ na trénování a kolik si ponecháš na testování.
Dosud jsi používal/a 70 % dat na trénování a 30 % na testování. Teď zkus 80 % dat na trénování a sleduj, jak se tím změní výkon modelu.
Toto cvičení je součástí kurzu
Marketing Analytics: Predicting Customer Churn in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = ____