1. Learn
  2. /
  3. Курси
  4. /
  5. Кероване навчання в R: регресія

Connected

Вправа

Генерування випадкового розподілу на тест/тренування

У наступних кількох вправах ви використовуватимете дані mpg з пакета ggplot2. Дані описують характеристики різних марок і моделей автомобілів за різні роки. Мета — передбачити міську витрату пального за шосейною витратою.

У цій вправі ви поділите mpg на тренувальну вибірку mpg_train (75% даних) і тестову вибірку mpg_test (25% даних). Один зі способів зробити це — згенерувати стовпець рівномірно розподілених випадкових чисел між 0 та 1 за допомогою функції runif() (docs).

Якщо у вас є набір даних dframe розміру \(N\) і ви хочете випадкову підмножину приблизного розміру \(100 * X\)% від \(N\) (де \(X\) між 0 та 1), тоді:

  1. Згенеруйте вектор рівномірно розподілених випадкових чисел: gp = runif(N).
  2. dframe[gp < X,] матиме приблизно потрібний розмір.
  3. dframe[gp >= X,] буде доповненням.

Інструкції

100 XP
  • Скористайтеся функцією nrow ([docs](https://www.rdocumentation.org/packages/base/topics/nrow)) щоб отримати кількість рядків у датафрейміmpg. Присвойте це значення зміннійN` і виведіть його.
  • Порахуйте, скільки рядків становитиме приблизно 75% від N. Присвойте це значення змінній target і виведіть його.
  • Використайте runif() щоб згенерувати вектор із N рівномірно розподілених випадкових чисел під назвою gp.
  • Використайте gp, щоб поділити mpg на mpg_train і mpg_test (де mpg_train містить приблизно 75% даних).
  • Скористайтеся nrow() щоб перевірити розмір mpg_train і mpg_test. Чи приблизно вони потрібного розміру?