Převod webové stránky na data pomocí BeautifulSoup: získávání hypertextových odkazů
V tomto cvičení zjistíš, jak z webové stránky BDFLa extrahovat URL adresy hypertextových odkazů. Při tom se dobře skamarádíš s metodou find_all() z knihovny BeautifulSoup.
Toto cvičení je součástí kurzu
Intermediate Importing Data in Python
Pokyny k cvičení
- Pomocí metody
find_all()najdi všechny hypertextové odkazy v objektusoup— pamatuj, že hypertextové odkazy jsou definovány HTML tagem<a>, který se ale dofind_all()předává bez ostrých závorek. Výsledek ulož do proměnnéa_tags. - Proměnná
a_tagsje množina výsledků: tvým úkolem je projít ji pomocíforsmyčky a vypsat skutečné URL adresy odkazů. Pro každý prveklinkva_tagszavolejprint()s argumentemlink.get('href').
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extracts the response as html: html_doc
html_doc = r.text
# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)
# Print the title of Guido's webpage
print(soup.title)
# Find all 'a' tags (which define hyperlinks): a_tags
# Print the URLs to the shell
for ____ in ____:
____