内容提取器
在之前的练习中,您已经确认给定的 URLs 向量中的所有元素都返回 200 状态码。既然知道这些页面可访问,接下来就更深入地进行网页抓取,提取页面内容。
为此,我们将使用 rvest 包中的函数,并通过 partial() 预填参数。本练习中要编写的函数会从页面中提取所有 H2 HTML 节点——在网页中,这些 H2 节点对应二级标题。提取到这些标题后,将使用 html_text() 函数把原始 HTML 中的文本内容提取出来。
purrr 和 rvest 已为您加载,工作区中也已提供向量 urls。
本练习是课程的一部分
使用 purrr 的函数式编程进阶
练习说明
先为
html_nodes()预填参数css = "h2"。将这个新函数与
read_html和html_text组合,创建一个用于提取H2标题文本的抽取器。在向量
urls上运行该函数,并为结果命名。打印结果,查看其结构。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)
# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)
# Map get_content to the urls list
res <- ___(urls, ___) %>%
set_names(___)
# Print the results to the console
___