Comece agoraComece grátis

Um extrator de conteúdo

Nos exercícios anteriores, você confirmou que todos os elementos do vetor de URLs fornecido retornam o código de status 200. Agora que você sabe que eles estão acessíveis, vamos avançar no web scraping fazendo extração de conteúdo.

Para isso, usaremos funções do pacote rvest, que serão pré-preenchidas com partial(). As funções que você vai escrever neste exercício vão extrair todos os nós HTML H2 de uma página — em uma página da web, esses nós H2 correspondem aos cabeçalhos de nível 2. Depois de extrair esses títulos, a função html_text() será usada para obter o conteúdo de texto do HTML bruto.

purrr e rvest já foram carregados para você, e o vetor urls está disponível no seu ambiente.

Este exercicio faz parte do curso

Programação Funcional Intermediária com purrr

Ver curso

Instruções do exercicio

  • Comece pré-preenchendo html_nodes() com css = "h2".

  • Combine essa função recém-criada entre read_html e html_text para criar um extrator de texto para cabeçalhos H2.

  • Execute essa função no vetor urls e nomeie o resultado.

  • Imprima o resultado para ver como ele fica.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Editar e Executar Código