用 httr 的方式来做
下面是一段我用来查询我最近度假地海拔的 rvest 代码。
# 从 Wikipedia 获取 HTML 文档
wikipedia_page <- read_html('https://en.wikipedia.org/wiki/Varigotti')
# 解析文档并从中提取海拔信息
wikipedia_page %>%
html_elements('table tr:nth-child(9) > td') %>%
html_text()
正如您在视频中学到的,如果传入的是 URL,read_html() 实际上会发出一次 HTTP GET 请求,就像这里这样。
本练习的目标是,在不使用 read_html() 的情况下,改用 httr 方法来复现同样的查询。
注意:通常用 rvest 就够了,但如果您想像本章后面展示的那样自定义请求,就需要掌握 httr 的用法。
作为小复习,您还将把 html_elements() 中用到的 CSS 选择器转换为一条 XPATH 查询。
本练习是课程的一部分
R 语言网页抓取
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Get the HTML document from Wikipedia using httr
wikipedia_response <- ___('https://en.wikipedia.org/wiki/Varigotti')
# Parse the response into an HTML doc
wikipedia_page <- ___(___)