Гипер(ссылки) в действии
Один из самых важных атрибутов при «веб-краулинге» — это URL гиперссылки (атрибут href) внутри тега a. В этом упражнении вы научитесь извлекать такую гиперссылку! Мы создали функцию print_attribute, которая выводит данные, полученные из вашего XPath, — так вы сможете тестировать XPath-строки прямо в консоли.
Упражнение основано на следующем HTML-коде:
<html>
<body>
<div id="div1" class="class-1">
<p class="class-1 class-2">Hello World!</p>
<div id="div2">
<p id="p2" class="class-2">Choose
<a href="http://datacamp.com">DataCamp!</a>!
</p>
</div>
</div>
<div id="div3" class="class-2">
<p class="class-2">Thanks for Watching!</p>
</div>
</body>
</html>
Это упражнение является частью курса
Веб-скрапинг на Python
Инструкции к упражнению
- Заполните пропуски в переменной
xpathниже, чтобы выбрать значение атрибутаhrefиз гиперссылки на DataCamp.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'
# Print out the selection(s); there should be only one
print_attribute( xpath )