ПочатиПочніть безкоштовно

Генерування випадкового розподілу на тест/тренування

У наступних кількох вправах ви використовуватимете дані mpg з пакета ggplot2. Дані описують характеристики різних марок і моделей автомобілів за різні роки. Мета — передбачити міську витрату пального за шосейною витратою.

У цій вправі ви поділите mpg на тренувальну вибірку mpg_train (75% даних) і тестову вибірку mpg_test (25% даних). Один зі способів зробити це — згенерувати стовпець рівномірно розподілених випадкових чисел між 0 та 1 за допомогою функції runif() (docs).

Якщо у вас є набір даних dframe розміру \(N\) і ви хочете випадкову підмножину приблизного розміру \(100 * X\)% від \(N\) (де \(X\) між 0 та 1), тоді:

  1. Згенеруйте вектор рівномірно розподілених випадкових чисел: gp = runif(N).
  2. dframe[gp < X,] матиме приблизно потрібний розмір.
  3. dframe[gp >= X,] буде доповненням.

Ця вправа є частиною курсу

Кероване навчання в R: регресія

Переглянути курс

Інструкції до вправи

  • Скористайтеся функцією nrow ([docs](https://www.rdocumentation.org/packages/base/topics/nrow)) щоб отримати кількість рядків у датафрейміmpg. Присвойте це значення зміннійN` і виведіть його.
  • Порахуйте, скільки рядків становитиме приблизно 75% від N. Присвойте це значення змінній target і виведіть його.
  • Використайте runif() щоб згенерувати вектор із N рівномірно розподілених випадкових чисел під назвою gp.
  • Використайте gp, щоб поділити mpg на mpg_train і mpg_test (де mpg_train містить приблизно 75% даних).
  • Скористайтеся nrow() щоб перевірити розмір mpg_train і mpg_test. Чи приблизно вони потрібного розміру?

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# mpg is available
summary(mpg)
dim(mpg)

# Use nrow to get the number of rows in mpg (N) and print it
(N <- ___)

# Calculate how many rows 75% of N should be and print it
# Hint: use round() to get an integer
(target <- ___)

# Create the vector of N uniform random variables: gp
gp <- ___

# Use gp to create the training set: mpg_train (75% of data) and mpg_test (25% of data)
mpg_train <- ___
mpg_test <- ___

# Use nrow() to examine mpg_train and mpg_test
___
___
Редагувати та запускати код