Kom igångKom igång gratis

EDA med NHANES

Nu ska vi utforska den nykonstruerade datamängden med fokus på EDA. Precis som i förra kapitlet är det bra att titta på både numeriska sammanfattningsmått och visualiseringar. Det ger en bättre förståelse av data och kan avslöja datarensningssteg som du kanske missat. Datamängden nhanes_combined är förhandsinläst åt dig.

Anta att vi har tillgång till NHANES-patienter och vill genomföra en studie om effekten av att en läkare rekommenderar patienten att minska sitt intag av kalorier och fett, och hur det påverkar vikten. Det här är vår behandling – vi låtsas att det i stället för att vara en fråga till patienten handlar om att vi slumpmässigt lät läkare ge kostråd till vissa patienter. Vi misstänker dock att det kan finnas en skillnad i vikt beroende på patientens kön – en blockeringsfaktor!

Den här övningen är en del av kursen

Experimentell design i R

Visa kurs

Övningsinstruktioner

  • Fyll i och kör dplyr-koden för att beräkna medelvikten (bmxwt) i kg per behandlingsgrupp (mcq365d). Finns det något intressant med patienterna i gruppen NA?
  • Fyll i ggplot2-koden för att visa ett lådagram över IQR för patienternas vikt uppdelat på behandlingsvariabeln.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Fill in the dplyr code
___ %>% 
  group_by(___) %>% 
  summarize(mean = mean(___, na.rm = TRUE))

# Fill in the ggplot2 code
___ %>% 
  ggplot(aes(as.factor(___), ___)) +
  geom_boxplot() +
  labs(x = "Treatment",
       y = "Weight")
Redigera och kör kod