Začněte nyníZačněte zdarma

Zkoumání struktury kategoriálních vstupů

V tomto cvičení zavoláš funkci model.matrix() (dokumentace), abys prozkoumal/a, jak R reprezentuje data s kategoriálními i numerickými vstupy pro modelování. Dataset flowers (odvozený z balíčku Sleuth3) je již načtený. Obsahuje následující sloupce:

  • Flowers: průměrný počet květů na rostlině meadowfoam
  • Intensity: intenzita světelného ošetření aplikovaného na rostlinu
  • Time: kategoriální proměnná – kdy (Late nebo Early) během životního cyklu světelné ošetření proběhlo

Cílem je předpovědět Flowers jako funkci proměnných Time a Intensity.

Toto cvičení je součástí kurzu

Supervised Learning in R: Regression

Zobrazit kurz

Pokyny k cvičení

  • Zavolej funkci str() na flowers a zjisti typy jednotlivých sloupců.
  • Použij funkci unique() na sloupci flowers$Time a zjisti, jaké hodnoty může Time nabývat. Kolik jedinečných hodnot existuje?
  • Vytvoř vzorec vyjadřující Flowers jako funkci Intensity a Time. Přiřaď ho do proměnné fmla a vypiš ho.
  • Pomocí fmla a model.matrix() vytvoř matici modelu pro datový rámec flowers. Výsledek přiřaď do proměnné mmat.
  • Pomocí head() si prohlédni prvních 20 řádků flowers.
  • Teď si prohlédni prvních 20 řádků mmat.
    • Liší se nějak numerický sloupec Intensity?
    • Co se stalo s kategoriálním sloupcem Time z flowers?
    • Jak je reprezentován případ Time == 'Early'? A Time == 'Late'?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Call str on flowers to see the types of each column
___

# Use unique() to see how many possible values Time takes
___

# Build and print a formula to express Flowers as a function of Intensity and Time: fmla
(fmla <- ___("Flowers ~ Intensity + Time"))

# Use fmla and model.matrix to see how the data is represented for modeling
mmat <- ___

# Examine the first 20 lines of flowers
___

# Examine the first 20 lines of mmat
___
Upravit a spustit kód