开始使用免费开始使用

用 httr 的方式来做

下面是一段我用来查询我最近度假地海拔的 rvest 代码。

# 从 Wikipedia 获取 HTML 文档
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# 解析文档并从中提取海拔信息
wikipedia_page %>% 
  html_elements('table tr:nth-child(9) > td') %>% 
  html_text()

正如您在视频中学到的,如果传入的是 URL,read_html() 实际上会发出一次 HTTP GET 请求,就像这里这样。

本练习的目标是,在不使用 read_html() 的情况下,改用 httr 方法来复现同样的查询。

注意:通常用 rvest 就够了,但如果您想像本章后面展示的那样自定义请求,就需要掌握 httr 的用法。

作为小复习,您还将把 html_elements() 中用到的 CSS 选择器转换为一条 XPATH 查询。

本练习是课程的一部分

R 语言网页抓取

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)
编辑并运行代码