Répondre aux questions avec des enchaînements
Lorsque vous avez une question précise sur un jeu de données, vous pouvez arriver à une réponse en construisant soigneusement l'enchaînement de code R approprié. Par exemple, considérez la question suivante : « Dans les courriels non pourriels, la longueur habituelle des messages est-elle plus courte pour ceux envoyés à plusieurs personnes? »
On peut y répondre avec l'enchaînement suivant :
email %>%
filter(spam == "not-spam") %>%
group_by(to_multiple) %>%
summarize(median(num_char))
Ce code montre clairement que vous utilisez num_char pour mesurer la longueur d'un courriel et median() comme mesure de ce qui est typique. Si vous exécutez ce code, vous apprendrez que la réponse est « oui » : la longueur typique des courriels non pourriels envoyés à plusieurs personnes est un peu inférieure à celle des messages envoyés à une seule personne.
Cet enchaînement se termine par des statistiques sommaires, mais d'autres peuvent aboutir à un graphique; tout dépend de la question à laquelle vous tentez de répondre.
Cette activité fait partie du cours
Analyse exploratoire des données en R
Instructions de l’exercice
Créez un enchaînement pour répondre à chacune des questions suivantes au sujet de la variable dollar.
- Pour les courriels contenant le mot « dollar », un pourriel type contient-il un plus grand nombre d'occurrences du mot qu'un courriel non pourriel type? Créez une statistique sommaire qui répond à cette question.
- Si vous tombez sur un courriel avec plus de 10 occurrences du mot
dollar, est-il plus susceptible d'être pourriel ou non pourriel? Créez un diagramme à barres qui répond à cette question.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Question 1
email %>%
filter(___) %>%
group_by(___) %>%
summarize(___)
# Question 2
email %>%
filter(___) %>%
ggplot(aes(x = ___)) +
geom_bar()