Створення тренувального та тестового наборів даних
Розбиття набору даних на тренувальний і тестовий — важливий крок під час побудови та перевірки моделі класифікації. Тренувальний набір використовують для побудови моделі, а тестовий — для оцінювання її прогностичної точності.
У цій вправі ви розіб'єте набір даних, створений у попередньому розділі, на тренувальний і тестовий. Набір даних завантажено в датафрейм df, а зерно генератора випадкових чисел уже встановлено для відтворюваності. Згадайте, що в попередньому відео ми задавали верхню межу для довжини тренувального набору за допомогою зручних функцій — тепер ваша черга їх реалізувати!
Ця вправа є частиною курсу
Support Vector Machines в R
Інструкції до вправи
- Визначте верхню межу кількості рядків у тренувальному наборі та збережіть її в
sample_size. - Створіть вектор
train, у якому збережено випадково призначені індекси тренувального набору згідно з пропорцією 80/20. - Призначте рядки з вектора
trainдо датафреймуtrainset, а решту — до датафреймуtestset.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]