用 Response 揭露
我們已經預先載入了一個名為 response 的 Response 物件,其中包含一個秘密網站的內容。你的任務是使用這個變數找出該網站的 URL 與標題。你在上一個單元已經學過如何找出 URL。若要找出網站標題,你需要知道:
- 標題是
title元素的文字。 title元素是head元素的子元素,而head元素則是html根元素的子元素。
注意:html 根元素只有一個子元素 head,而 head 元素也只有一個子元素 title。
本練習屬於課程
Python 網頁爬蟲
練習說明
- 將載入
response變數時使用的網址指派給變數this_url。 - 將載入
response變數時所對應網站的標題指派給變數this_title。由於我們只需要選到的單一元素中的文字,請使用extract_first()方法來擷取文字。 - 不論你使用
xpath或css,都要確認你選取的是標題元素內的文字,而不只是選到標題元素本身。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Get the URL to the website loaded in response
this_url = ____
# Get the title of the website loaded in response
this_title = response.____.extract_first()
# Print out our findings
print_url_title( this_url, this_title )