EDA pe datele NHANES
Hai să explorăm setul de date pe care tocmai l-am construit, cu accent pe analiza exploratorie a datelor (EDA). Ca și în capitolul anterior, este util să examinezi atât măsuri de rezumat numerice, cât și vizualizări. Acestea te ajută să înțelegi datele și să identifici eventuale etape de curățare pe care le-ai putea fi ratat. Setul de date nhanes_combined a fost pre-încărcat pentru tine.
Să presupunem că avem acces la pacienții NHANES și dorim să realizăm un studiu privind efectul recomandării medicale de reducere a caloriilor/grăsimilor din dietă asupra greutății corporale. Acesta este tratamentul nostru; ne imaginăm că, în loc ca aceasta să fie o întrebare adresată pacientului, medicii au consiliat aleatoriu anumiți pacienți cu privire la nutriție. Totuși, suspectăm că ar putea exista diferențe de greutate în funcție de genul pacientului – un factor de blocare!
Acest exercițiu face parte din cursul
Design Experimental în R
Instrucțiuni pentru exercițiu
- Completează și rulează codul
dplyrpentru a calcula greutatea medie (bmxwt) în kg în funcție de tratamentul nostru (mcq365d). Observi ceva interesant la pacienții cu valoareaNApentru tratament? - Completează codul
ggplot2pentru a vizualiza un boxplot al IQR-ului greutăților pacienților în funcție de variabila de tratament.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fill in the dplyr code
___ %>%
group_by(___) %>%
summarize(mean = mean(___, na.rm = TRUE))
# Fill in the ggplot2 code
___ %>%
ggplot(aes(as.factor(___), ___)) +
geom_boxplot() +
labs(x = "Treatment",
y = "Weight")