Comece agoraComece grátis

Analisando URLs

Ainda estamos trabalhando na exploração do conjunto de dados #RStudioConf. Neste exercício, vamos focar em analisar as URLs contidas nos tweets.

As URLs estão em um elemento chamado "url_urls". Esses elementos "url_urls" contêm NULL quando não há URL no tweet, ou uma lista com uma ou mais URLs.

Vamos começar extraindo todos os elementos "url_urls" do conjunto de dados e, em seguida, combinar purrr e stringr para contar quantos tweets contêm um link para uma URL relacionada ao GitHub. Como o GitHub é um site popular entre desenvolvedores, uma alta presença desse site indicará uma comunidade forte de desenvolvedores no nosso conjunto de dados.

purrr e stringr já foram carregados para você, e o conjunto de dados rstudioconf ainda está disponível no seu ambiente de trabalho.

Este exercicio faz parte do curso

Programação Funcional Intermediária com purrr

Ver curso

Instruções do exercicio

  • Extraia todos os elementos "urls_url" e passe o resultado para flatten() para remover um nível de hierarquia.

  • Remova os NULL dos resultados.

  • Crie um mapper chamado has_github, que detecta se uma string de caracteres contém "github".

  • Use a variante map_*() para lógicos com has_github e passe o resultado para sum() para contar o número de links que contêm "github".

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Extract the "urls_url" elements, and flatten() the result
urls_clean <- ___(rstudioconf, ___) %>%
  ___()

# Remove the NULL
compact_urls <- ___(___)

# Create a mapper that detects the patten "github"
has_github <- ___(~ str_detect(.x, "github"))

# Look for the "github" pattern, and sum the result
___( compact_urls, has_github ) %>%
  ___()
Editar e Executar Código