Criando conjuntos de treino e teste
Dividir um conjunto de dados em conjuntos de treino e teste é uma etapa importante para construir e testar um modelo de classificação. O conjunto de treino é usado para construir o modelo e o conjunto de teste, para avaliar sua precisão preditiva.
Neste exercício, você vai dividir o conjunto de dados que criou no capítulo anterior em conjuntos de treino e teste. O conjunto de dados já foi carregado no data frame df e uma semente já foi definida para garantir a reprodutibilidade. Lembre-se de que, no vídeo anterior, definimos o limite superior para o tamanho do conjunto de treino com algumas funções práticas — agora é a sua vez de implementá-las!
Este exercicio faz parte do curso
Support Vector Machines em R
Instruções do exercicio
- Determine o limite superior para o número de linhas que estarão no conjunto de treino e armazene-o em
sample_size. - Crie o vetor
train, que armazena a amostra aleatória do conjunto de treino de acordo com a proporção 80/20. - Atribua as linhas no vetor
trainao data frametrainsete o restante ao data frametestset.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]