Hiper(link)activ
Unul dintre cele mai importante atribute de extras pentru „web crawling" este URL-ul hiperlinkului (atributul href) din interiorul unui tag a. În acest exercițiu, vei extrage exact un astfel de hyperlink! Am creat funcția print_attribute pentru a afișa datele extrase din XPath-ul tău, astfel încât să poți testa șirurile XPath în consolă, dacă dorești.
Exercițiul face referire la următorul cod sursă HTML:
<html>
<body>
<div id="div1" class="class-1">
<p class="class-1 class-2">Hello World!</p>
<div id="div2">
<p id="p2" class="class-2">Choose
<a href="http://datacamp.com">DataCamp!</a>!
</p>
</div>
</div>
<div id="div3" class="class-2">
<p class="class-2">Thanks for Watching!</p>
</div>
</body>
</html>
Acest exercițiu face parte din cursul
Web Scraping în Python
Instrucțiuni pentru exercițiu
- Completează spațiile libere pentru a finaliza variabila
xpathde mai jos, astfel încât să selecteze valoarea atributuluihrefdin hiperlinkul DataCamp.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create an xpath to the href attribute
xpath = '//p[@id=____]/a/____'
# Print out the selection(s); there should be only one
print_attribute( xpath )