CommencerCommencez gratuitement

Nous tenons notre gagnant !

Dans cet exercice, nous allons identifier un indicateur clé : quel est l’utilisateur qui a publié le tweet avec le plus de retweets ?

Ce type d’information est essentiel pour l’analyse des réseaux sociaux : il vous renseigne sur le tweet le plus « célèbre » de votre jeu de données. Cela peut aider, par la suite, à déterminer les principaux thèmes et utilisateurs pour un thème ou un hashtag donné.

Nous allons utiliser purrr pour extraire le tweet le plus retweeté de notre corpus et identifier l’utilisateur à l’origine de ce tweet. Comme nous voulons limiter l’analyse aux tweets originaux, nous vous fournissons la liste non_rt, créée dans un exercice précédent.

Cet exercice fait partie du cours

<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>
Voir le cours

Instructions de l’exercice

  • Extrayez tous les éléments "retweet_count" avec la variante map_*() appropriée. Passez le résultat à max().

  • Préremplissez un map_at(), avec .at égal à "retweet_count" et .f étant un mapper qui teste l’égalité à max_rt.

  • Appliquez cette nouvelle fonction à non_rt, ne gardez que "retweet_count", puis aplatissez le résultat.

  • Affichez dans la console les champs $screen_name et $text du résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Get the max() of "retweet_count" 
max_rt <- ___(non_rt, ___) %>% 
  ___()

# Prefill map_at() with a mapper testing if .x equal max_rt
max_rt_calc <- ___(___, .at = "retweet_count", .f := ~ ___ )

res <- non_rt %>%
  # Call max_rt_calc() on each element
  ___(___) %>% 
  # Keep elements where retweet_count is non-zero
  ___("___") %>% 
  # Flatten it
  ___()

# Print the "screen_name" and "text" of the result
res$screen_name
res$text
Modifier et exécuter le code