Zacznij terazZacznij za darmo

Parsowanie HTML z BeautifulSoup

W tym interaktywnym ćwiczeniu nauczysz się używać pakietu BeautifulSoup do parsowania, formatowania i wyodrębniania informacji z HTML. Pobierzesz dane ze strony internetowej Guido van Rossuma, twórcy Pythona i jego Dożywotniego Życzliwego Dyktatora. W kolejnych ćwiczeniach sformatujesz kod HTML, a następnie wyodrębnisz tekst i hiperłącza.

Interesujący nas URL to url = 'https://www.python.org/~guido/'.

To ćwiczenie jest częścią kursu

Importowanie danych w Pythonie – poziom średniozaawansowany

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcję BeautifulSoup z pakietu bs4.
  • Przypisz interesujący nas URL do zmiennej url.
  • Przygotuj żądanie do podanego URL, wyślij je i przechwyć odpowiedź za pomocą jednej funkcji requests.get(), przypisując odpowiedź do zmiennej r.
  • Użyj atrybutu text obiektu r, aby uzyskać kod HTML strony w postaci ciągu znaków; zapisz wynik w zmiennej html_doc.
  • Utwórz obiekt BeautifulSoup o nazwie soup z uzyskanego kodu HTML, używając funkcji BeautifulSoup().
  • Wywołaj metodę prettify() na obiekcie soup i przypisz wynik do zmiennej pretty_soup.
  • Kliknij Prześlij odpowiedź, aby wyświetlić sformatowany kod HTML w konsoli!

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
Edytuj i uruchom kod