Kom igångKom igång gratis

Hyper(länk)aktiv

Ett av de viktigaste attributen att extrahera vid webbskrapning är hyperlänkens url (attributet href) inuti en a-tagg. Här får du extrahera just en sådan hyperlänk! Vi har skapat funktionen print_attribute för att skriva ut den data som din XPath extraherar, så du kan testa dina XPath-strängar i konsolen om du vill.

Övningen utgår från följande HTML-källkod:

<html>
  <body>
    <div id="div1" class="class-1">
      <p class="class-1 class-2">Hello World!</p>
      <div id="div2">
        <p id="p2" class="class-2">Choose 
            <a href="http://datacamp.com">DataCamp!</a>!
        </p>
      </div>
    </div>
    <div id="div3" class="class-2">
      <p class="class-2">Thanks for Watching!</p>
    </div>
  </body>
</html>

Den här övningen är en del av kursen

Webbskrapning i Python

Visa kurs

Övningsinstruktioner

  • Fyll i luckorna för att färdigställa variabeln xpath nedan, så att den väljer ut attributvärdet href från DataCamp-hyperlänken.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'

# Print out the selection(s); there should be only one
print_attribute( xpath )
Redigera och kör kod