Avslöja med Response
Vi har förladdat ett Response-objekt, med namnet response, med innehållet från en hemlig webbplats. Din uppgift är att ta reda på URL:en och titeln på webbplatsen med hjälp av variabeln response. Du lärde dig hur man hittar URL:en i den förra lektionen. För att hitta webbplatsens titel behöver du känna till följande:
- Titeln är texten från elementet
title - Elementet
titleär ett barn till elementethead, som i sin tur är ett barn till rotelementethtml.
Notera att rotelementet html bara har ett enda head-element som barn, och head-elementet har bara ett enda title-element som barn.
Den här övningen är en del av kursen
Webbskrapning i Python
Övningsinstruktioner
- Tilldela variabeln
this_urlden URL som användes för att ladda variabelnresponse. - Tilldela variabeln
this_titletiteln på webbplatsen som användes för att ladda variabelnresponse. Eftersom vi bara vill ha texten från det enskilda element vi väljer, använder vi metodenextract_first()för att extrahera texten. - Oavsett om du använder
xpathellercss, se till att du väljer texten inuti title-elementet, och inte bara elementet i sig.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Get the URL to the website loaded in response
this_url = ____
# Get the title of the website loaded in response
this_title = response.____.extract_first()
# Print out our findings
print_url_title( this_url, this_title )