所有层级的文本
本练习与上一题相似,但不同之处在于,您将从某个元素的多代子孙中选择文本。
您需要编写 XPath 和 CSS 定位符字符串,指向某个特定段落 p 元素的文本。HTML 中该 p 元素由其 id 属性唯一标识,为 "p3"。仅凭这条信息,您就应该能够构建所需的字符串;不过,我们也已将变量 html 预加载为包含此链接所属 HTML 的字符串,若您想先浏览可使用它。
在本练习中,您只需选择该元素内部的文本,并且要包含其后代各代中的所有文本。我们已为您创建了函数 print_results,方便您比较字符串所指向的元素。
本练习是课程的一部分
Python Web 爬取
练习说明
- 将变量
xpath赋值为一个 XPath 字符串,指向id等于p3的段落p元素内部的文本,并且要包含该p元素所有后代的文本。 - 将变量
css_locator赋值为一个 CSS 定位符字符串,指向相同的文本。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create an XPath string to the desired text.
xpath = ____
# Create a CSS Locator string to the desired text.
css_locator = ____
# Print the text from our selections
print_results( xpath, css_locator )