Exploration des données NHANES
Examinons le jeu de données que nous venons de créer en pensant à l'exploration de données (EDA). Comme dans le chapitre précédent, il est judicieux d'observer à la fois des mesures résumées numériques et des visualisations. Cela aide à comprendre les données et permet souvent de repérer des étapes de nettoyage que vous auriez pu manquer. Le jeu de données nhanes_combined a été préchargé pour vous.
Supposons que nous ayons accès à des patients de l'étude NHANES et que nous voulions mener une étude sur l'effet, sur le poids, du fait qu'un médecin leur ait recommandé de réduire les calories et les gras dans leur alimentation. C'est notre traitement; faisons comme si, plutôt que d'être une question posée au patient, nous avions aléatoirement demandé à des médecins de conseiller certains patients sur leur nutrition. Cependant, nous soupçonnons qu'il pourrait y avoir une différence de poids selon le genre du patient — un facteur de blocage!
Cette activité fait partie du cours
Plan d'expériences avec R
Instructions de l’exercice
- Complétez et exécutez le code
dplyrpour trouver le poids moyen (bmxwt) en kg selon notre traitement (mcq365d). Y a-t-il quelque chose d'intéressant concernant les patients avec une valeurNApour le traitement? - Complétez le code
ggplot2pour visualiser un diagramme à moustaches (boîte) de l'IQR des poids des patients selon la variable de traitement.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Fill in the dplyr code
___ %>%
group_by(___) %>%
summarize(mean = mean(___, na.rm = TRUE))
# Fill in the ggplot2 code
___ %>%
ggplot(aes(as.factor(___), ___)) +
geom_boxplot() +
labs(x = "Treatment",
y = "Weight")