回到办公室
您仍在一家网络代理公司担任数据分析师,被要求进行网页抓取。您拿到了一组需要分析的 URL,这项分析在上一章中您已经开始过。
您预期这项任务会反复出现:毫无疑问,几周后还会再次让您做。为了让将来的工作更轻松,您决定现在就写出更干净的代码,便于日后回看与复用。
我们将从组合上一章见过的两个 httr 函数开始:用于获取网页的 GET(),以及用于提取状态码的 status_code(),以创建一个状态码提取器。
urls 向量仍在您的工作区中。我们只保留了可访问的 URL。
本练习是课程的一部分
使用 purrr 的函数式编程进阶
练习说明
加载
purrr和httr。使用
GET()和status_code()组合出一个状态码提取函数。将这个新函数试用在 "https://www.thinkr.fr" 和 "https://en.wikipedia.org" 上。
直接将该函数映射到向量
urls上。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Launch purrr and httr
# Compose a status extractor
status_extract <- ___(___, ___)
# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")
# Map it on the urls vector, return a vector of numbers
___(urls, ___)