Um extrator de conteúdo
Nos exercícios anteriores, você confirmou que todos os elementos do vetor de URLs fornecido retornam o código de status 200. Agora que você sabe que eles estão acessíveis, vamos avançar no web scraping fazendo extração de conteúdo.
Para isso, usaremos funções do pacote rvest, que serão pré-preenchidas com partial(). As funções que você vai escrever neste exercício vão extrair todos os nós HTML H2 de uma página — em uma página da web, esses nós H2 correspondem aos cabeçalhos de nível 2. Depois de extrair esses títulos, a função html_text() será usada para obter o conteúdo de texto do HTML bruto.
purrr e rvest já foram carregados para você, e o vetor urls está disponível no seu ambiente.
Este exercicio faz parte do curso
Programação Funcional Intermediária com purrr
Instruções do exercicio
Comece pré-preenchendo
html_nodes()comcss = "h2".Combine essa função recém-criada entre
read_htmlehtml_textpara criar um extrator de texto para cabeçalhosH2.Execute essa função no vetor
urlse nomeie o resultado.Imprima o resultado para ver como ele fica.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___