CommencerCommencez gratuitement

Extraire les mentions

Dans chaque sous-liste de l’ensemble de tweets, il y a un élément appelé "mentions_screen_name" (c.-à-d. les identifiants Twitter). Cet élément contient soit NULL s’il n’y a aucune mention dans le tweet, soit un ou plusieurs pseudos mentionnés dans le tweet. Une façon de repérer un compte populaire à partir d’une liste de tweets est d’identifier les utilisateurs les plus mentionnés dans un corpus donné.

Nous allons d’abord extraire un vecteur de toutes les mentions, puis, une fois ce nouveau vecteur obtenu, nous compterons combien de fois chaque profil est mentionné. Pour cela, nous allons construire une nouvelle fonction composée, en combinant table() (qui compte le nombre d’occurrences de chaque élément du vecteur), sort() et tail().

purrr a été chargé pour vous, et rstudioconf est disponible dans votre jeu de données.

Cet exercice fait partie du cours

<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>
Voir le cours

Instructions de l’exercice

  • Créez une fonction qui combine as_vector(), compact() et flatten().

  • Créez une fonction qui prend deux arguments : list et what. Cette fonction exécutera map( list, what ), puis transmettra le résultat à flatten_to_vector.

  • Créez six_most, une fonction qui combine tail(), sort() et table().

  • Exécutez extractor() sur rstudioconf, puis passez le résultat à six_most().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Combine as_vector(), compact(), and flatten()
flatten_to_vector <- ___(___, ___, ___)

# Complete the function
extractor <- function(list, what = "mentions_screen_name"){
  map( ___ , ___ ) %>%
    ___()
}

# Create six_most, with tail(), sort(), and table()
six_most <- ___(___, ___, ___)

# Run extractor() on rstudioconf
___(rstudioconf) %>% 
  ___()
Modifier et exécuter le code