Identifier des profils
Nous poursuivons l'exploration de notre jeu de données de tweets. Ces éléments sont contenus dans une liste imbriquée de 5 055 sous-listes, que nous explorons avec purrr.
Dans cet exercice, nous répondons à une question sur le comportement des utilisateurs : combien d'utilisateurs n'ont fait que des retweets, sans jamais publier de « contenu original »? Une règle générale sur Twitter veut qu'environ 80 % des gens ne fassent que retweeter, tandis que 20 % publient du contenu, selon la loi de Pareto. Nous allons le vérifier ici.
Pour ce faire, nous devrons scinder notre jeu de données en deux, puis compter le nombre total d'utilisateurs et combien se trouvent uniquement dans le groupe « retweet seulement ».
purrr a été chargé pour vous, et la liste rstudioconf est toujours disponible dans votre espace de travail.
Cette activité fait partie du cours
Programmation fonctionnelle intermédiaire avec purrr
Instructions de l’exercice
Créez une sous-liste de retweets, extrayez l'élément
user_id, puis supprimez les doublons avecunique().Créez une sous-liste de tweets originaux, extrayez l'élément
user_id, puis supprimez les doublons avecunique().Combinez
union()(de R de base) etlength()pour obtenir le nombre total d'utilisateurs.Utilisez la fonction
setdiff()(de R de base) pour obtenir les utilisateurs qui se trouvent uniquement dans la sous-liste des retweets.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Keep the RT, extract the user_id, remove the duplicate
rt <- ___(___, "is_retweet") %>%
___("user_id") %>%
___()
# Remove the RT, extract the user id, remove the duplicate
non_rt <- ___(rstudioconf, "is_retweet") %>%
___("user_id") %>%
___()
# Determine the total number of users
___(rt, non_rt) %>% ___()
# Determine the number of users who has just retweeted
___(rt, non_rt) %>% ___()