НачатьНачать бесплатно

Гипер(ссылки) в действии

Один из самых важных атрибутов при «веб-краулинге» — это URL гиперссылки (атрибут href) внутри тега a. В этом упражнении вы научитесь извлекать такую гиперссылку! Мы создали функцию print_attribute, которая выводит данные, полученные из вашего XPath, — так вы сможете тестировать XPath-строки прямо в консоли.

Упражнение основано на следующем HTML-коде:

<html>
  <body>
    <div id="div1" class="class-1">
      <p class="class-1 class-2">Hello World!</p>
      <div id="div2">
        <p id="p2" class="class-2">Choose 
            <a href="http://datacamp.com">DataCamp!</a>!
        </p>
      </div>
    </div>
    <div id="div3" class="class-2">
      <p class="class-2">Thanks for Watching!</p>
    </div>
  </body>
</html>

Это упражнение является частью курса

Веб-скрапинг на Python

Посмотреть курс

Инструкции к упражнению

  • Заполните пропуски в переменной xpath ниже, чтобы выбрать значение атрибута href из гиперссылки на DataCamp.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'

# Print out the selection(s); there should be only one
print_attribute( xpath )
Редактировать и запускать код