善用 ID 的唯一性
如你所知,ID 在同一個網頁中應該是唯一的。若能確保這一點,就能大幅降低爬取時選擇器的複雜度。
以下是你在實務上可能會遇到的 HTML 頁面結構:
<html>
<body>
<div id = 'first'>
<h1 class = 'big'>Joe Biden</h1>
<p class = 'first blue'>Democrat</p>
<p class = 'second blue'>Male</p>
</div>
<div id = 'second'>...</div>
<div id = 'third'>
<h1 class = 'big'>Donald Trump</h1>
<p class = 'first red'>Republican</p>
<p class = 'second red'>Male</p>
</div>
</body>
</html>
已經替你用 read_html() 讀入,並存放在 structured_html 中。
本練習屬於課程
R 的網頁爬蟲
練習說明
- 使用
html_elements(),找出能選取structured_html中第一個div的最短選擇器。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Select the first div
structured_html %>%
___