Bắt đầu ngayBắt đầu miễn phí

Liên kết (hyper) hoạt động

Một trong những thuộc tính quan trọng nhất cần trích xuất khi "web-crawling" là url siêu liên kết (thuộc tính href) trong thẻ a. Ở đây, bạn sẽ trích xuất một siêu liên kết như vậy! Chúng tôi đã tạo hàm print_attribute để in ra dữ liệu được trích xuất từ XPath của bạn, vì vậy bạn có thể thử nghiệm các chuỗi XPath trong bảng điều khiển nếu muốn.

Bài tập này tham chiếu đến mã nguồn HTML sau:

<html>
  <body>
    <div id="div1" class="class-1">
      <p class="class-1 class-2">Hello World!</p>
      <div id="div2">
        <p id="p2" class="class-2">Choose 
            <a href="http://datacamp.com">DataCamp!</a>!
        </p>
      </div>
    </div>
    <div id="div3" class="class-2">
      <p class="class-2">Thanks for Watching!</p>
    </div>
  </body>
</html>

Bài tập này là một phần của khóa học

Web Scraping với Python

Xem khóa học

Hướng dẫn bài tập

  • Điền vào chỗ trống để hoàn thiện biến xpath bên dưới nhằm chọn giá trị thuộc tính href từ siêu liên kết DataCamp.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'

# Print out the selection(s); there should be only one
print_attribute( xpath )
Chỉnh sửa và Chạy Mã