Analysera HTML med BeautifulSoup
I den här övningen får du lära dig att använda paketet BeautifulSoup för att analysera, formatera och extrahera information från HTML. Du skrapar data från webbsidan tillhörande Guido van Rossum, Pythons egne Benevolent Dictator for Life. I kommande övningar formaterar du HTML-koden och extraherar sedan text och hyperlänkar.
URL:en du ska använda är url = 'https://www.python.org/~guido/'.
Den här övningen är en del av kursen
Importera data i Python – fortsättningskurs
Övningsinstruktioner
- Importera funktionen
BeautifulSoupfrån paketetbs4. - Tilldela den aktuella URL:en till variabeln
url. - Skicka förfrågan till URL:en och fånga svaret med funktionen
requests.get()i ett enda steg – tilldela svaret till variabelnr. - Använd attributet
texthos objektetrför att hämta webbsidans HTML som en sträng och lagra resultatet i variabelnhtml_doc. - Skapa ett BeautifulSoup-objekt
soupfrån den hämtade HTML-koden med funktionenBeautifulSoup(). - Använd metoden
prettify()påsoupoch tilldela resultatet tillpretty_soup. - Klicka på Skicka in svar för att skriva ut den formaterade HTML-koden i din terminal!
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)