ÎncepețiÎncepe gratuit

Hiper(link)activ

Unul dintre cele mai importante atribute de extras pentru „web crawling" este URL-ul hiperlinkului (atributul href) din interiorul unui tag a. În acest exercițiu, vei extrage exact un astfel de hyperlink! Am creat funcția print_attribute pentru a afișa datele extrase din XPath-ul tău, astfel încât să poți testa șirurile XPath în consolă, dacă dorești.

Exercițiul face referire la următorul cod sursă HTML:

<html>
  <body>
    <div id="div1" class="class-1">
      <p class="class-1 class-2">Hello World!</p>
      <div id="div2">
        <p id="p2" class="class-2">Choose 
            <a href="http://datacamp.com">DataCamp!</a>!
        </p>
      </div>
    </div>
    <div id="div3" class="class-2">
      <p class="class-2">Thanks for Watching!</p>
    </div>
  </body>
</html>

Acest exercițiu face parte din cursul

Web Scraping în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează spațiile libere pentru a finaliza variabila xpath de mai jos, astfel încât să selecteze valoarea atributului href din hiperlinkul DataCamp.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'

# Print out the selection(s); there should be only one
print_attribute( xpath )
Editează și rulează codul