Visualisera brottsdata från Maryland
Innan du anpassar en modell kan det vara bra att plotta datan för att se om det finns trender, avvikande värden eller andra egenskaper som behöver beaktas.
Med ggplot2 kan du rita linjer för varje county och undersöka hur brottsligheten förändras över tid.
I den här övningen studerar du brottsdata från Maryland (md_crime). Datamängden innehåller Year, ett antal våldsbrott (Crime) i varje county, samt countyts namn (County).
Börja med att plotta datapunkterna för varje county över tid. Det ger en bild av hur varje county förändras med åren. Istället för ett estetikattribut som color används här group, eftersom det finns för många counties för att enkelt skilja färgerna åt. Lägg sedan till trendlinjer för varje county.
Både de sammankopplade punkterna (geom_line) och trendlinjerna (geom_smooth) ger ledtrådar om vilka slumpmässiga effekter som eventuellt behövs. Om alla punkter verkar ha liknande spridning och medelvärden kanske ett slumpmässigt intercept inte är viktigt. På samma sätt – om trenderna ser likartade ut för alla counties (det vill säga att trendlinjerna ser parallella ut) kanske en slumpmässig lutning inte behövs.
Den här övningen är en del av kursen
Hierarkiska modeller och modeller med blandade effekter i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Plot the change in crime through time by County
plot1 <-
ggplot(data = md_crime,
aes(x = ___, y = ___, group = ___)) +
geom_line() +
theme_minimal() +
ylab("Major crimes reported per county")
print(plot1)
# Add the trend line for each county
plot1 + ___