Comece agoraComece grátis

Criando conjuntos de treino e teste

Dividir um conjunto de dados em conjuntos de treino e teste é uma etapa importante para construir e testar um modelo de classificação. O conjunto de treino é usado para construir o modelo e o conjunto de teste, para avaliar sua precisão preditiva.

Neste exercício, você vai dividir o conjunto de dados que criou no capítulo anterior em conjuntos de treino e teste. O conjunto de dados já foi carregado no data frame df e uma semente já foi definida para garantir a reprodutibilidade. Lembre-se de que, no vídeo anterior, definimos o limite superior para o tamanho do conjunto de treino com algumas funções práticas — agora é a sua vez de implementá-las!

Este exercicio faz parte do curso

Support Vector Machines em R

Ver curso

Instruções do exercicio

  • Determine o limite superior para o número de linhas que estarão no conjunto de treino e armazene-o em sample_size.
  • Crie o vetor train, que armazena a amostra aleatória do conjunto de treino de acordo com a proporção 80/20.
  • Atribua as linhas no vetor train ao data frame trainset e o restante ao data frame testset.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Editar e Executar Código