Дослідження структури категоріальних вхідних даних
У цій вправі ви викличете model.matrix() (docs), щоб
перевірити, як R подає дані з категоріальними та числовими вхідними ознаками для моделювання.
Набір даних flowers (походить із пакета Sleuth3) уже завантажено. Він містить такі стовпці:
Flowers: середня кількість квіток на рослині meadowfoamIntensity: інтенсивність світлового впливу, застосованого до рослиниTime: категоріальна змінна — коли (LateабоEarly) в життєвому циклі відбувався світловий вплив
Кінцева мета — передбачати Flowers як функцію від Time та Intensity.
Ця вправа є частиною курсу
Кероване навчання в R: регресія
Інструкції до вправи
- Викличте функцію
str()дляflowers, щоб побачити типи кожного стовпця. - Скористайтеся функцією
unique()для стовпцяflowers$Time, щоб побачити можливі значення змінноїTime. Скільки унікальних значень? - Створіть формулу, яка виражає
Flowersяк функцію відIntensityтаTime. Присвойте її зміннійfmlaі виведіть на друк. - Використайте
fmlaіmodel.matrix(), щоб створити матрицю моделі для датафреймуflowers. Присвойте її зміннійmmat. - Використайте
head(), щоб переглянути перші 20 рядківflowers. - Тепер перегляньте перші 20 рядків
mmat.- Чи відрізняється числовий стовпець
Intensity? - Що сталося з категоріальним стовпцем
Timeзflowers? - Як подано
Time == 'Early'? АTime == 'Late'?
- Чи відрізняється числовий стовпець
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Call str on flowers to see the types of each column
___
# Use unique() to see how many possible values Time takes
___
# Build and print a formula to express Flowers as a function of Intensity and Time: fmla
(fmla <- ___("Flowers ~ Intensity + Time"))
# Use fmla and model.matrix to see how the data is represented for modeling
mmat <- ___
# Examine the first 20 lines of flowers
___
# Examine the first 20 lines of mmat
___