Analisando URLs
Ainda estamos trabalhando na exploração do conjunto de dados #RStudioConf. Neste exercício, vamos focar em analisar as URLs contidas nos tweets.
As URLs estão em um elemento chamado "url_urls". Esses elementos "url_urls" contêm NULL quando não há URL no tweet, ou uma lista com uma ou mais URLs.
Vamos começar extraindo todos os elementos "url_urls" do conjunto de dados e, em seguida, combinar purrr e stringr para contar quantos tweets contêm um link para uma URL relacionada ao GitHub. Como o GitHub é um site popular entre desenvolvedores, uma alta presença desse site indicará uma comunidade forte de desenvolvedores no nosso conjunto de dados.
purrr e stringr já foram carregados para você, e o conjunto de dados rstudioconf ainda está disponível no seu ambiente de trabalho.
Este exercicio faz parte do curso
Programação Funcional Intermediária com purrr
Instruções do exercicio
Extraia todos os elementos
"urls_url"e passe o resultado paraflatten()para remover um nível de hierarquia.Remova os
NULLdos resultados.Crie um mapper chamado
has_github, que detecta se uma string de caracteres contém"github".Use a variante
map_*()para lógicos comhas_githube passe o resultado parasum()para contar o número de links que contêm"github".
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
___()
# Remove the NULL
compact_urls <- ___(___)
# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))
# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
___()