給定這棵 HTML 樹,下列哪一個描述無法正確導覽到包含「Hello World!」的段落元素?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
學習 HTML 的結構。我們先說明為什麼網頁爬蟲能成為你資料科學工具箱中的有力補充,接著帶你認識 HTML 基礎。章末將簡要介紹 XPath 標記法,這是用來在 HTML 程式碼中導航各元素的工具。
當前練習
運用 XPath 語法來探索 scrapy 的選取器。這兩個概念都能幫助你更進一步擷取 HTML 文件中的內容。
學習 CSS 定位器語法,並嘗試把 CSS 定位器與 XPath 串接使用。我們也會介紹 Response 物件,它的行為類似 Selector,但提供額外工具,讓我們能把爬取流程擴展到多個網站。
學習使用 scrapy 建立網頁爬蟲。這些 scrapy 蜘蛛會在多個頁面之間爬行,依照前幾章學到的流程,自動追蹤連結並爬取各個頁面。