Parsování HTML pomocí BeautifulSoup
V tomto interaktivním cvičení se naučíš, jak pomocí balíčku BeautifulSoup parsovat, upravovat a extrahovat informace z HTML. Budeme scrapovat data z webové stránky Guida van Rossuma, zakladatele Pythonu a jeho Benevolentního doživotního diktátora. V dalších cvičeních pak HTML upravíš do čitelné podoby a extrahujete z něj text i hypertextové odkazy.
URL, se kterým budeme pracovat, je url = 'https://www.python.org/~guido/'.
Toto cvičení je součástí kurzu
Intermediate Importing Data in Python
Pokyny k cvičení
- Importuj funkci
BeautifulSoupz balíčkubs4. - Přiřaď URL, se kterým chceš pracovat, do proměnné
url. - Pomocí funkce
requests.get()sestav požadavek na dané URL, odešli ho a zachyť odpověď — výsledek ulož do proměnnér. - Pomocí atributu
textobjekturzískej HTML stránky jako řetězec a výsledek ulož do proměnnéhtml_doc. - Pomocí funkce
BeautifulSoup()vytvoř z tohoto HTML objektsoup. - Na objektu
soupzavolej metoduprettify()a výsledek ulož do proměnnépretty_soup. - Klikni na Odeslat a zobraz upravené HTML ve svém shellu!
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)