使用 XPATH 按类和 ID 选择
下面的 HTML 代码与您在上一章见过的类似(已读入名为 weather_html 的 HTML 文档):
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Berlin Weather Station</h1>
<p class = 'first'>Temperature: 20°C</p>
<p class = 'second'>Humidity: 45%</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<p class = 'first'>Sunshine: 5hrs</p>
<p class = 'second'>Precipitation: 0mm</p>
</div>
</body>
</html>
在本章中,这段代码更贴近真实网页。您的目标是从该气象站中提取降水量读数。遗憾的是,它不能通过 ID 直接定位。
我们一步一步搭建所需的选择器,然后把它们组合起来完成任务吧!
本练习是课程的一部分
R 语言网页抓取
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Select all p elements
weather_html %>%
html_elements(xpath = '___')