Comece agoraComece grátis

Outro extrator

No exercício anterior, criamos uma função capaz de extrair o conteúdo de texto de cabeçalhos H2.

Agora vamos tentar outra coisa: queremos extrair todos os links que existem em uma página específica. Para isso, vamos precisar chamar duas funções do httr: html_nodes(), com o argumento css definido como "a" (a é a tag HTML para links), e html_attr(), que extrai um atributo de um nó — no nosso caso, esse atributo será "href", que é o endereço do link.

purrr e rvest já foram carregados para você. Você ainda encontra o vetor urls no seu ambiente de trabalho.

Este exercicio faz parte do curso

Programação Funcional Intermediária com purrr

Ver curso

Instruções do exercicio

  • Pré-preencha html_nodes() com o argumento css definido como "a".

  • Crie a função href(), que será uma versão pré-preenchida de html_attr().

  • Faça a composição de uma nova combinação de href(), get_a() e read_html().

  • Aplique essa nova função ao vetor urls.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Create a partial version of html_nodes(), with the css param set to "a"
get_a <- ___(html_nodes, ___)

# Create href(), a partial version of html_attr()
href <- ___(___, name = "href")

# Combine href(), get_a(), and read_html()
get_links <- ___(___, ___, ___)

# Map get_links() to the urls list
res <- ___(urls, ___) %>%
  set_names(urls)

# See the result
res
Editar e Executar Código