CommencerCommencez gratuitement

Analyser des URL

Nous poursuivons l’exploration du jeu de données #RStudioConf. Dans cet exercice, nous allons analyser les URL présentes dans les tweets.

Les URL se trouvent dans un élément appelé "url_urls". Ces éléments "url_urls" contiennent soit NULL s’il n’y avait pas d’URL dans le tweet, soit une liste d’une ou plusieurs URL.

Nous allons commencer par extraire tous les éléments "url_urls" du jeu de données, puis combiner purrr et stringr pour compter combien de tweets contiennent un lien vers une URL liée à GitHub. Comme GitHub est un site très utilisé par les développeurs, une forte présence de ce site indiquera une communauté de développeurs importante dans notre jeu de données.

purrr et stringr ont été chargés pour vous, et le jeu de données rstudioconf est toujours disponible dans votre espace de travail.

Cet exercice fait partie du cours

<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>
Voir le cours

Instructions de l’exercice

  • Extrayez tous les éléments "urls_url", puis transmettez le résultat à flatten() pour supprimer un niveau d’imbrication.

  • Supprimez les NULL des résultats.

  • Créez un mapper appelé has_github, qui détecte si une chaîne de caractères contient "github".

  • Utilisez la variante map_*() logique avec has_github, puis passez le résultat à sum() pour compter le nombre de liens contenant "github".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Modifier et exécuter le code