Začněte nyníZačněte zdarma

Parsování HTML pomocí BeautifulSoup

V tomto interaktivním cvičení se naučíš, jak pomocí balíčku BeautifulSoup parsovat, upravovat a extrahovat informace z HTML. Budeme scrapovat data z webové stránky Guida van Rossuma, zakladatele Pythonu a jeho Benevolentního doživotního diktátora. V dalších cvičeních pak HTML upravíš do čitelné podoby a extrahujete z něj text i hypertextové odkazy.

URL, se kterým budeme pracovat, je url = 'https://www.python.org/~guido/'.

Toto cvičení je součástí kurzu

Intermediate Importing Data in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkci BeautifulSoup z balíčku bs4.
  • Přiřaď URL, se kterým chceš pracovat, do proměnné url.
  • Pomocí funkce requests.get() sestav požadavek na dané URL, odešli ho a zachyť odpověď — výsledek ulož do proměnné r.
  • Pomocí atributu text objektu r získej HTML stránky jako řetězec a výsledek ulož do proměnné html_doc.
  • Pomocí funkce BeautifulSoup() vytvoř z tohoto HTML objekt soup.
  • Na objektu soup zavolej metodu prettify() a výsledek ulož do proměnné pretty_soup.
  • Klikni na Odeslat a zobraz upravené HTML ve svém shellu!

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
Upravit a spustit kód