Wizualizacja danych o przestępczości w Maryland
Przed dopasowaniem modelu warto zwizualizować dane, aby zobaczyć, czy widoczne są jakieś trendy, wartości odstające lub inne cechy wymagające uwagi.
Korzystając z ggplot2, możesz narysować linie dla każdego hrabstwa i sprawdzić, jak przestępczość zmienia się w czasie.
W tym ćwiczeniu przeanalizuj dane o przestępczości w Maryland (md_crime). Zbiór zawiera zmienną Year (rok), liczbę przestępstw z użyciem przemocy (Crime) oraz nazwę hrabstwa (County).
Aby zbadać te dane, najpierw narysuj punkty dla każdego hrabstwa w czasie. Dzięki temu zobaczysz, jak każde hrabstwo zmienia się na przestrzeni lat. Zamiast estetyki color użyto tutaj group, ponieważ hrabstw jest zbyt wiele, by łatwo rozróżnić kolory. Po narysowaniu surowych danych dodaj linie trendu dla każdego hrabstwa.
Zarówno połączone punkty (geom_line), jak i linie trendu (geom_smooth) pozwalają ocenić, jakie efekty losowe – jeśli w ogóle – są potrzebne. Jeśli wszystkie punkty mają podobny zakres i średnią, losowy efekt dla wyrazu wolnego może nie być istotny. Podobnie, jeśli trendy wyglądają spójnie we wszystkich hrabstwach (czyli linie trendu są do siebie podobne lub równoległe), losowy efekt dla nachylenia może nie być wymagany.
To ćwiczenie jest częścią kursu
Hierarchiczne i mieszane modele efektów w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Plot the change in crime through time by County
plot1 <-
ggplot(data = md_crime,
aes(x = ___, y = ___, group = ___)) +
geom_line() +
theme_minimal() +
ylab("Major crimes reported per county")
print(plot1)
# Add the trend line for each county
plot1 + ___