Zkoumání struktury kategoriálních vstupů
V tomto cvičení zavoláš funkci model.matrix() (dokumentace), abys
prozkoumal/a, jak R reprezentuje data s kategoriálními i numerickými vstupy pro modelování.
Dataset flowers (odvozený z balíčku Sleuth3) je již načtený. Obsahuje následující sloupce:
Flowers: průměrný počet květů na rostlině meadowfoamIntensity: intenzita světelného ošetření aplikovaného na rostlinuTime: kategoriální proměnná – kdy (LateneboEarly) během životního cyklu světelné ošetření proběhlo
Cílem je předpovědět Flowers jako funkci proměnných Time a Intensity.
Toto cvičení je součástí kurzu
Supervised Learning in R: Regression
Pokyny k cvičení
- Zavolej funkci
str()naflowersa zjisti typy jednotlivých sloupců. - Použij funkci
unique()na sloupciflowers$Timea zjisti, jaké hodnoty můžeTimenabývat. Kolik jedinečných hodnot existuje? - Vytvoř vzorec vyjadřující
Flowersjako funkciIntensityaTime. Přiřaď ho do proměnnéfmlaa vypiš ho. - Pomocí
fmlaamodel.matrix()vytvoř matici modelu pro datový rámecflowers. Výsledek přiřaď do proměnnémmat. - Pomocí
head()si prohlédni prvních 20 řádkůflowers. - Teď si prohlédni prvních 20 řádků
mmat.- Liší se nějak numerický sloupec
Intensity? - Co se stalo s kategoriálním sloupcem
Timezflowers? - Jak je reprezentován případ
Time == 'Early'? ATime == 'Late'?
- Liší se nějak numerický sloupec
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Call str on flowers to see the types of each column
___
# Use unique() to see how many possible values Time takes
___
# Build and print a formula to express Flowers as a function of Intensity and Time: fmla
(fmla <- ___("Flowers ~ Intensity + Time"))
# Use fmla and model.matrix to see how the data is represented for modeling
mmat <- ___
# Examine the first 20 lines of flowers
___
# Examine the first 20 lines of mmat
___