使用 XPATH 依 class 與 ID 選取
以下這段 HTML 與你在上一章看過的程式碼很像(已讀入為名為 weather_html 的 HTML 文件):
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Berlin Weather Station</h1>
<p class = 'first'>Temperature: 20°C</p>
<p class = 'second'>Humidity: 45%</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<p class = 'first'>Sunshine: 5hrs</p>
<p class = 'second'>Precipitation: 0mm</p>
</div>
</body>
</html>
在本章中,這段程式碼更貼近實務。你的目標是從這個氣象站中擷取「降水量」讀數。不過,它無法直接用 ID 參照。
我們一步一步先建立基本選取式,最後再把它們組合起來!
本練習屬於課程
R 的網頁爬蟲
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Select all p elements
weather_html %>%
html_elements(xpath = '___')