CommencezCommencez gratuitement

Exploration des données NHANES

Examinons le jeu de données que nous venons de créer en pensant à l'exploration de données (EDA). Comme dans le chapitre précédent, il est judicieux d'observer à la fois des mesures résumées numériques et des visualisations. Cela aide à comprendre les données et permet souvent de repérer des étapes de nettoyage que vous auriez pu manquer. Le jeu de données nhanes_combined a été préchargé pour vous.

Supposons que nous ayons accès à des patients de l'étude NHANES et que nous voulions mener une étude sur l'effet, sur le poids, du fait qu'un médecin leur ait recommandé de réduire les calories et les gras dans leur alimentation. C'est notre traitement; faisons comme si, plutôt que d'être une question posée au patient, nous avions aléatoirement demandé à des médecins de conseiller certains patients sur leur nutrition. Cependant, nous soupçonnons qu'il pourrait y avoir une différence de poids selon le genre du patient — un facteur de blocage!

Cette activité fait partie du cours

Plan d'expériences avec R

Voir le cours

Instructions de l’exercice

  • Complétez et exécutez le code dplyr pour trouver le poids moyen (bmxwt) en kg selon notre traitement (mcq365d). Y a-t-il quelque chose d'intéressant concernant les patients avec une valeur NA pour le traitement?
  • Complétez le code ggplot2 pour visualiser un diagramme à moustaches (boîte) de l'IQR des poids des patients selon la variable de traitement.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Fill in the dplyr code
___ %>% 
  group_by(___) %>% 
  summarize(mean = mean(___, na.rm = TRUE))

# Fill in the ggplot2 code
___ %>% 
  ggplot(aes(as.factor(___), ___)) +
  geom_boxplot() +
  labs(x = "Treatment",
       y = "Weight")
Modifier et exécuter le code