De volta ao escritório
Você ainda está trabalhando como analista de dados em uma agência web e recebeu a tarefa de fazer web scraping. Você recebeu uma lista de URLs para analisar — uma análise que você já começou no capítulo anterior.
Você espera que essa tarefa seja recorrente: sem dúvida vão pedir para você fazer isso de novo em algumas semanas. Para facilitar seu trabalho no futuro, você decidiu escrever um código limpo hoje, para ficar mais fácil retomar depois.
Vamos começar combinando as duas funções do httr que vimos no capítulo anterior: GET(), para recuperar a página, e status_code(), para extrair o status HTTP, a fim de criar um extrator de código de status.
O vetor urls ainda está disponível no seu workspace. Mantivemos apenas as URLs que estão acessíveis.
Este exercicio faz parte do curso
Programação Funcional Intermediária com purrr
Instruções do exercicio
Carregue
purrrehttr.Compose um extrator de status com
GET()estatus_code().Teste essa nova função em "https://www.thinkr.fr" e "https://en.wikipedia.org".
Aplique essa função diretamente ao vetor
urls.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)