开始使用免费开始使用

回到办公室

您仍在一家网络代理公司担任数据分析师,被要求进行网页抓取。您拿到了一组需要分析的 URL,这项分析在上一章中您已经开始过。

您预期这项任务会反复出现:毫无疑问,几周后还会再次让您做。为了让将来的工作更轻松,您决定现在就写出更干净的代码,便于日后回看与复用。

我们将从组合上一章见过的两个 httr 函数开始:用于获取网页的 GET(),以及用于提取状态码的 status_code(),以创建一个状态码提取器。

urls 向量仍在您的工作区中。我们只保留了可访问的 URL。

本练习是课程的一部分

使用 purrr 的函数式编程进阶

查看课程

练习说明

  • 加载 purrrhttr

  • 使用 GET()status_code() 组合出一个状态码提取函数。

  • 将这个新函数试用在 "https://www.thinkr.fr" 和 "https://en.wikipedia.org" 上。

  • 直接将该函数映射到向量 urls 上。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
编辑并运行代码