所有層級的文字
這題和上一題相似,但不同之處在於你要從指定元素的多個後代層級中選取文字。
你要撰寫 XPath 與 CSS Locator 字串,導向特定段落 p 元素的文字。HTML 中的這個 p 元素透過其 id 屬性唯一識別,為 "p3"。有了這個小線索,你應該能組出需要的字串。不過我們已經預先載入了變數 html,其中包含此連結所屬的 HTML 字串,若你想先瀏覽也可以。
在本題中,你只會選取該元素內的文字,且會「包含」所有未來世代(後代)中的文字。我們已為你建立函式 print_results,方便你比較你的字串實際指向哪些元素。
本練習屬於課程
Python 網頁爬蟲
練習說明
- 指派給變數
xpath一個 XPath 字串,導向id等於p3的段落p元素內的文字,且要「包含」此p元素所有後代的文字。 - 指派給變數
css_locator一個 CSS Locator 字串,導向相同的文字內容。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create an XPath string to the desired text.
xpath = ____
# Create a CSS Locator string to the desired text.
css_locator = ____
# Print the text from our selections
print_results( xpath, css_locator )