开始使用免费开始使用

超(链接)活跃

在进行"网页爬取"时,最重要的属性之一是 a 标签中的超链接 URL(href 属性)。在本练习中,您将提取这样一个超链接!我们已创建函数 print_attribute 来打印您用 XPath 提取的数据,方便您在控制台中测试 XPath 字符串(如果您愿意)。

本练习参照以下 HTML 源代码:

<html>
  <body>
    <div id="div1" class="class-1">
      <p class="class-1 class-2">Hello World!</p>
      <div id="div2">
        <p id="p2" class="class-2">Choose 
            <a href="http://datacamp.com">DataCamp!</a>!
        </p>
      </div>
    </div>
    <div id="div3" class="class-2">
      <p class="class-2">Thanks for Watching!</p>
    </div>
  </body>
</html>

本练习是课程的一部分

Python Web 爬取

查看课程

练习说明

  • 填空完成下面的变量 xpath,以从 DataCamp 的超链接中选取 href 属性值。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'

# Print out the selection(s); there should be only one
print_attribute( xpath )
编辑并运行代码