Průzkumná analýza dat NHANES
Pojďme prozkoumat náš nově sestavený dataset s ohledem na průzkumnou analýzu dat. Stejně jako v předchozí kapitole se vyplatí podívat se jak na numerické souhrnné míry, tak na vizualizace. Pomáhají lépe pochopit data a mohou odhalit kroky čištění dat, které ti možná unikly. Dataset nhanes_combined je předem načtený.
Představ si, že máš přístup k pacientům z NHANES a chceš provést studii o tom, jaký vliv má doporučení lékaře snížit příjem kalorií a tuků na hmotnost pacientů. To je naše léčba – budeme předstírat, že místo dotazování pacienta jsme náhodně vybrali lékaře, kteří část pacientů poradili ohledně výživy. Domníváme se ale, že hmotnost se může lišit podle pohlaví pacienta – a to je náš blokující faktor!
Toto cvičení je součástí kurzu
Experimental Design in R
Pokyny k cvičení
- Doplň a spusť kód
dplyr, který vypočítá průměrnou hmotnost (bmxwt) v kilogramech podle léčby (mcq365d). Všimneš si něčeho zajímavého u pacientů s hodnotouNA? - Doplň kód
ggplot2pro zobrazení krabicového grafu mezikvartilového rozsahu hmotnosti pacientů podle proměnné léčby.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fill in the dplyr code
___ %>%
group_by(___) %>%
summarize(mean = mean(___, na.rm = TRUE))
# Fill in the ggplot2 code
___ %>%
ggplot(aes(as.factor(___), ___)) +
geom_boxplot() +
labs(x = "Treatment",
y = "Weight")