Analyser des URL
Nous poursuivons l’exploration du jeu de données #RStudioConf. Dans cet exercice, nous allons analyser les URL présentes dans les tweets.
Les URL se trouvent dans un élément appelé "url_urls". Ces éléments "url_urls" contiennent soit NULL s’il n’y avait pas d’URL dans le tweet, soit une liste d’une ou plusieurs URL.
Nous allons commencer par extraire tous les éléments "url_urls" du jeu de données, puis combiner purrr et stringr pour compter combien de tweets contiennent un lien vers une URL liée à GitHub. Comme GitHub est un site très utilisé par les développeurs, une forte présence de ce site indiquera une communauté de développeurs importante dans notre jeu de données.
purrr et stringr ont été chargés pour vous, et le jeu de données rstudioconf est toujours disponible dans votre espace de travail.
Cet exercice fait partie du cours
<cours>Programmation fonctionnelle intermédiaire avec purrr</cours>Instructions de l’exercice
Extrayez tous les éléments
"urls_url", puis transmettez le résultat àflatten()pour supprimer un niveau d’imbrication.Supprimez les
NULLdes résultats.Créez un mapper appelé
has_github, qui détecte si une chaîne de caractères contient"github".Utilisez la variante
map_*()logique avechas_github, puis passez le résultat àsum()pour compter le nombre de liens contenant"github".
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()