Descoperă prin Response
Am încărcat în prealabil un obiect Response, numit response, cu conținutul unui site misterios. Sarcina ta este să determini URL-ul și titlul acelui site folosind variabila response. Ai învățat cum să obții URL-ul în lecția anterioară. Pentru a găsi titlul site-ului, trebuie să știi că:
- Titlul reprezintă textul din elementul
title - Elementul
titleeste un copil al elementuluihead, care la rândul său este un copil al elementului rădăcinăhtml.
De reținut: elementul rădăcină html are un singur element copil head, iar elementul head are un singur element copil title.
Acest exercițiu face parte din cursul
Web Scraping în Python
Instrucțiuni pentru exercițiu
- Atribuie variabilei
this_urlURL-ul folosit pentru a încărca variabilaresponse. - Atribuie variabilei
this_titletitlul site-ului folosit pentru a încărca variabilaresponse. Deoarece dorim doar textul din singurul element selectat, folosim metodaextract_first()pentru a extrage textul. - Indiferent dacă folosești
xpathsaucss, asigură-te că selectezi textul din interiorul elementului title, nu elementul title în sine.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Get the URL to the website loaded in response
this_url = ____
# Get the title of the website loaded in response
this_title = response.____.extract_first()
# Print out our findings
print_url_title( this_url, this_title )