Variando o tamanho do conjunto de treino
O tamanho dos seus conjuntos de treino e teste influencia o desempenho do modelo. Os modelos aprendem melhor quando têm mais dados de treino. No entanto, há o risco de overfitting aos dados de treino e de não generalizar bem para novos dados; por isso, para avaliar corretamente a capacidade de generalização do modelo, você precisa de dados de teste suficientes. Como resultado, existe um equilíbrio e um trade-off importantes entre quanto você usa para treino e quanto reserva para teste.
Até agora, você usou 70% para treino e 30% para teste. Agora, vamos usar 80% dos dados para treino e avaliar como isso muda o desempenho do modelo.
Este exercicio faz parte do curso
Análise de Marketing: Prevendo Churn de Clientes em Python
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = ____