Parsowanie HTML z BeautifulSoup
W tym interaktywnym ćwiczeniu nauczysz się używać pakietu BeautifulSoup do parsowania, formatowania i wyodrębniania informacji z HTML. Pobierzesz dane ze strony internetowej Guido van Rossuma, twórcy Pythona i jego Dożywotniego Życzliwego Dyktatora. W kolejnych ćwiczeniach sformatujesz kod HTML, a następnie wyodrębnisz tekst i hiperłącza.
Interesujący nas URL to url = 'https://www.python.org/~guido/'.
To ćwiczenie jest częścią kursu
Importowanie danych w Pythonie – poziom średniozaawansowany
Instrukcje do ćwiczenia
- Zaimportuj funkcję
BeautifulSoupz pakietubs4. - Przypisz interesujący nas URL do zmiennej
url. - Przygotuj żądanie do podanego URL, wyślij je i przechwyć odpowiedź za pomocą jednej funkcji
requests.get(), przypisując odpowiedź do zmiennejr. - Użyj atrybutu
textobiektur, aby uzyskać kod HTML strony w postaci ciągu znaków; zapisz wynik w zmiennejhtml_doc. - Utwórz obiekt BeautifulSoup o nazwie
soupz uzyskanego kodu HTML, używając funkcjiBeautifulSoup(). - Wywołaj metodę
prettify()na obiekciesoupi przypisz wynik do zmiennejpretty_soup. - Kliknij Prześlij odpowiedź, aby wyświetlić sformatowany kod HTML w konsoli!
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)