用 Response 揭晓
我们已预先加载了一个名为 response 的 Response 对象,其中包含来自某个神秘网站的内容。您的任务是使用该变量找出该网站的 URL 和标题。上一节您已经学过如何找到 URL。若要找到网站标题,您需要知道:
- 标题来自
title元素的文本 title元素是head元素的子元素,而head又是html根元素的子元素。
请注意:html 根元素只有一个子元素 head,而 head 元素也只有一个子元素 title。
本练习是课程的一部分
Python Web 爬取
练习说明
- 将用于加载
response变量的 URL 赋值给变量this_url。 - 将用于加载
response变量的网站标题赋值给变量this_title。由于我们只需要选中的单个元素的文本,因此请使用extract_first()方法提取文本。 - 无论您使用
xpath还是css,都要确保选择的是标题元素中的文本,而不仅仅是元素本身。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Get the URL to the website loaded in response
this_url = ____
# Get the title of the website loaded in response
this_title = response.____.extract_first()
# Print out our findings
print_url_title( this_url, this_title )