Transformarea unei pagini web în date cu BeautifulSoup: extragerea hyperlink-urilor
În acest exercițiu, vei descoperi cum să extragi URL-urile hyperlink-urilor de pe pagina web a BDFL. Pe parcurs, vei deveni un bun cunoscător al metodei find_all() din BeautifulSoup.
Acest exercițiu face parte din cursul
Importul intermediar de date în Python
Instrucțiuni pentru exercițiu
- Folosește metoda
find_all()pentru a găsi toate hyperlink-urile dinsoup, ținând cont că hyperlink-urile sunt definite de tag-ul HTML<a>, dar se transmit cătrefind_all()fără paranteze unghiulare; stochează rezultatul în variabilaa_tags. - Variabila
a_tagseste un set de rezultate: sarcina ta acum este să o parcurgi cu o buclăforși să afișezi URL-urile efective ale hyperlink-urilor; pentru asta, pentru fiecare elementlinkdina_tags, apeleazăprint()culink.get('href').
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extracts the response as html: html_doc
html_doc = r.text
# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)
# Print the title of Guido's webpage
print(soup.title)
# Find all 'a' tags (which define hyperlinks): a_tags
# Print the URLs to the shell
for ____ in ____:
____