or
本練習屬於課程
學習 HTML 的結構。我們先說明為什麼網頁爬蟲能成為你資料科學工具箱中的有力補充,接著帶你認識 HTML 基礎。章末將簡要介紹 XPath 標記法,這是用來在 HTML 程式碼中導航各元素的工具。
運用 XPath 語法來探索 scrapy 的選取器。這兩個概念都能幫助你更進一步擷取 HTML 文件中的內容。
當前練習
學習 CSS 定位器語法,並嘗試把 CSS 定位器與 XPath 串接使用。我們也會介紹 Response 物件,它的行為類似 Selector,但提供額外工具,讓我們能把爬取流程擴展到多個網站。
學習使用 scrapy 建立網頁爬蟲。這些 scrapy 蜘蛛會在多個頁面之間爬行,依照前幾章學到的流程,自動追蹤連結並爬取各個頁面。