Outro extrator
No exercício anterior, criamos uma função capaz de extrair o conteúdo de texto de cabeçalhos H2.
Agora vamos tentar outra coisa: queremos extrair todos os links que existem em uma página específica. Para isso, vamos precisar chamar duas funções do httr: html_nodes(), com o argumento css definido como "a" (a é a tag HTML para links), e html_attr(), que extrai um atributo de um nó — no nosso caso, esse atributo será "href", que é o endereço do link.
purrr e rvest já foram carregados para você. Você ainda encontra o vetor urls no seu ambiente de trabalho.
Este exercicio faz parte do curso
Programação Funcional Intermediária com purrr
Instruções do exercicio
Pré-preencha
html_nodes()com o argumentocssdefinido como"a".Crie a função
href(), que será uma versão pré-preenchida dehtml_attr().Faça a composição de uma nova combinação de
href(),get_a()eread_html().Aplique essa nova função ao vetor
urls.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Create a partial version of html_nodes(), with the css param set to "a"
get_a <- ___(html_nodes, ___)
# Create href(), a partial version of html_attr()
href <- ___(___, name = "href")
# Combine href(), get_a(), and read_html()
get_links <- ___(___, ___, ___)
# Map get_links() to the urls list
res <- ___(urls, ___) %>%
set_names(urls)
# See the result
res