ПочатиПочніть безкоштовно

Створення тренувального та тестового наборів даних

Розбиття набору даних на тренувальний і тестовий — важливий крок під час побудови та перевірки моделі класифікації. Тренувальний набір використовують для побудови моделі, а тестовий — для оцінювання її прогностичної точності.

У цій вправі ви розіб'єте набір даних, створений у попередньому розділі, на тренувальний і тестовий. Набір даних завантажено в датафрейм df, а зерно генератора випадкових чисел уже встановлено для відтворюваності. Згадайте, що в попередньому відео ми задавали верхню межу для довжини тренувального набору за допомогою зручних функцій — тепер ваша черга їх реалізувати!

Ця вправа є частиною курсу

Support Vector Machines в R

Переглянути курс

Інструкції до вправи

  • Визначте верхню межу кількості рядків у тренувальному наборі та збережіть її в sample_size.
  • Створіть вектор train, у якому збережено випадково призначені індекси тренувального набору згідно з пропорцією 80/20.
  • Призначте рядки з вектора train до датафрейму trainset, а решту — до датафрейму testset.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Редагувати та запускати код