开始使用免费开始使用

内容提取器

在之前的练习中,您已经确认给定的 URLs 向量中的所有元素都返回 200 状态码。既然知道这些页面可访问,接下来就更深入地进行网页抓取,提取页面内容。

为此,我们将使用 rvest 包中的函数,并通过 partial() 预填参数。本练习中要编写的函数会从页面中提取所有 H2 HTML 节点——在网页中,这些 H2 节点对应二级标题。提取到这些标题后,将使用 html_text() 函数把原始 HTML 中的文本内容提取出来。

purrrrvest 已为您加载,工作区中也已提供向量 urls

本练习是课程的一部分

使用 purrr 的函数式编程进阶

查看课程

练习说明

  • 先为 html_nodes() 预填参数 css = "h2"

  • 将这个新函数与 read_htmlhtml_text 组合,创建一个用于提取 H2 标题文本的抽取器。

  • 在向量 urls 上运行该函数,并为结果命名。

  • 打印结果,查看其结构。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
编辑并运行代码