ПочатиПочніть безкоштовно

Дослідження структури категоріальних вхідних даних

У цій вправі ви викличете model.matrix() (docs), щоб перевірити, як R подає дані з категоріальними та числовими вхідними ознаками для моделювання. Набір даних flowers (походить із пакета Sleuth3) уже завантажено. Він містить такі стовпці:

  • Flowers: середня кількість квіток на рослині meadowfoam
  • Intensity: інтенсивність світлового впливу, застосованого до рослини
  • Time: категоріальна змінна — коли (Late або Early) в життєвому циклі відбувався світловий вплив

Кінцева мета — передбачати Flowers як функцію від Time та Intensity.

Ця вправа є частиною курсу

Кероване навчання в R: регресія

Переглянути курс

Інструкції до вправи

  • Викличте функцію str() для flowers, щоб побачити типи кожного стовпця.
  • Скористайтеся функцією unique() для стовпця flowers$Time, щоб побачити можливі значення змінної Time. Скільки унікальних значень?
  • Створіть формулу, яка виражає Flowers як функцію від Intensity та Time. Присвойте її змінній fmla і виведіть на друк.
  • Використайте fmla і model.matrix(), щоб створити матрицю моделі для датафрейму flowers. Присвойте її змінній mmat.
  • Використайте head(), щоб переглянути перші 20 рядків flowers.
  • Тепер перегляньте перші 20 рядків mmat.
    • Чи відрізняється числовий стовпець Intensity?
    • Що сталося з категоріальним стовпцем Time з flowers?
    • Як подано Time == 'Early'? А Time == 'Late'?

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Call str on flowers to see the types of each column
___

# Use unique() to see how many possible values Time takes
___

# Build and print a formula to express Flowers as a function of Intensity and Time: fmla
(fmla <- ___("Flowers ~ Intensity + Time"))

# Use fmla and model.matrix to see how the data is represented for modeling
mmat <- ___

# Examine the first 20 lines of flowers
___

# Examine the first 20 lines of mmat
___
Редагувати та запускати код