Identifier des profils
Nous poursuivons l’exploration de notre jeu de données de tweets. Ces éléments sont contenus dans une liste imbriquée de 5055 sous-listes, que nous examinons avec purrr.
Dans cet exercice, nous allons répondre à une question sur le comportement des utilisateurs : combien d’utilisateurs n’ont fait que retweeter, sans jamais publier de « contenu original » ? Une règle générale sur Twitter est qu’environ 80 % des personnes ne font que retweeter, tandis que 20 % publient du contenu, conformément à la loi de Pareto. Nous allons le vérifier ici.
Pour ce faire, nous allons diviser notre jeu de données en deux, puis compter le nombre total d’utilisateurs, et combien se trouvent uniquement dans le groupe « retweet uniquement ».
purrr a été chargé pour vous, et la liste rstudioconf est toujours disponible dans votre espace de travail.
Cet exercice fait partie du cours
<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>Instructions de l’exercice
Créez une sous-liste de retweets, extrayez l’élément
user_id, puis supprimez les doublons avecunique().Créez une sous-liste de tweets originaux, extrayez l’élément
user_id, puis supprimez les doublons avecunique().Combinez
union()(de base R) etlength()pour obtenir le nombre total d’utilisateurs.Utilisez la fonction
setdiff()(de base R) pour récupérer les utilisateurs qui ne figurent que dans la sous-liste des retweets.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
___("user_id") %>%
___()
# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
___("user_id") %>%
___()
# Determine the total number of users
___(rt, non_rt) %>% ___()
# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()