Liên kết (hyper) hoạt động
Một trong những thuộc tính quan trọng nhất cần trích xuất khi "web-crawling" là url siêu liên kết (thuộc tính href) trong thẻ a. Ở đây, bạn sẽ trích xuất một siêu liên kết như vậy! Chúng tôi đã tạo hàm print_attribute để in ra dữ liệu được trích xuất từ XPath của bạn, vì vậy bạn có thể thử nghiệm các chuỗi XPath trong bảng điều khiển nếu muốn.
Bài tập này tham chiếu đến mã nguồn HTML sau:
<html>
<body>
<div id="div1" class="class-1">
<p class="class-1 class-2">Hello World!</p>
<div id="div2">
<p id="p2" class="class-2">Choose
<a href="http://datacamp.com">DataCamp!</a>!
</p>
</div>
</div>
<div id="div3" class="class-2">
<p class="class-2">Thanks for Watching!</p>
</div>
</body>
</html>
Bài tập này là một phần của khóa học
Web Scraping với Python
Hướng dẫn bài tập
- Điền vào chỗ trống để hoàn thiện biến
xpathbên dưới nhằm chọn giá trị thuộc tínhhreftừ siêu liên kết DataCamp.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'
# Print out the selection(s); there should be only one
print_attribute( xpath )