or
本練習屬於課程
在本章中,你將認識超文件標示語言(HTML),這是一種用來構建現代網站結構的宣告式語言。你會使用 rvest 函式庫學習如何查詢簡單的 HTML 元素,並完成你的第一個表格爬取。
階層式樣式表(CSS)描述了 HTML 元素在網頁上的呈現方式,包括顏色、字型與整體版面配置。在本章中,你將了解為何 CSS 選擇器與組合子是進行網頁爬蟲時不可或缺的關鍵工具。
你在上一章學到的 CSS 選擇器功能強大,但仍有其限制,例如當你想根據子孫節點的屬性來選取節點時。這時就輪到 XPath 出馬了!使用這套查詢語言,你可以在雜亂的 HTML 結構中進行導覽與爬取。
當前練習
既然你已經知道如何從網頁擷取內容,現在該揭開幕後原理。在最後一章中,你將學到為何 HTTP 請求是每個爬蟲動作的基礎,以及如何調整請求以符合網頁爬蟲的最佳實務。