Analiza struktury zmiennych kategorycznych
W tym ćwiczeniu wywołasz funkcję model.matrix() (dokumentacja), aby sprawdzić, jak R reprezentuje dane zawierające zarówno zmienne kategoryczne, jak i liczbowe podczas modelowania.
Zbiór danych flowers (oparty na pakiecie Sleuth3) jest już wczytany. Zawiera następujące kolumny:
Flowers: średnia liczba kwiatów na roślinie meadowfoamIntensity: natężenie zastosowanego oświetleniaTime: zmienna kategoryczna – moment (LatelubEarly) w cyklu życia rośliny, w którym zastosowano oświetlenie
Celem jest przewidzenie wartości Flowers na podstawie Time i Intensity.
To ćwiczenie jest częścią kursu
Nadzorowane uczenie maszynowe w R: regresja
Instrukcje do ćwiczenia
- Wywołaj funkcję
str()na zbiorzeflowers, aby zobaczyć typy poszczególnych kolumn. - Użyj funkcji
unique()na kolumnieflowers$Time, aby sprawdzić możliwe wartości zmiennejTime. Ile unikalnych wartości zawiera? - Utwórz formułę wyrażającą
Flowersjako funkcjęIntensityiTime. Przypisz ją do zmiennejfmlai wyświetl. - Użyj
fmlaimodel.matrix(), aby utworzyć macierz modelu dla ramki danychflowers. Przypisz wynik do zmiennejmmat. - Użyj funkcji
head(), aby przejrzeć pierwsze 20 wierszy zbioruflowers. - Teraz przejrzyj pierwsze 20 wierszy zmiennej
mmat.- Czy kolumna liczbowa
Intensityróżni się czymś? - Co stało się z kolumną kategoryczną
Timeze zbioruflowers? - Jak jest reprezentowany warunek
Time == 'Early'? ATime == 'Late'?
- Czy kolumna liczbowa
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Call str on flowers to see the types of each column
___
# Use unique() to see how many possible values Time takes
___
# Build and print a formula to express Flowers as a function of Intensity and Time: fmla
(fmla <- ___("Flowers ~ Intensity + Time"))
# Use fmla and model.matrix to see how the data is represented for modeling
mmat <- ___
# Examine the first 20 lines of flowers
___
# Examine the first 20 lines of mmat
___