Kom igångKom igång gratis

Analysera HTML med BeautifulSoup

I den här övningen får du lära dig att använda paketet BeautifulSoup för att analysera, formatera och extrahera information från HTML. Du skrapar data från webbsidan tillhörande Guido van Rossum, Pythons egne Benevolent Dictator for Life. I kommande övningar formaterar du HTML-koden och extraherar sedan text och hyperlänkar.

URL:en du ska använda är url = 'https://www.python.org/~guido/'.

Den här övningen är en del av kursen

Importera data i Python – fortsättningskurs

Visa kurs

Övningsinstruktioner

  • Importera funktionen BeautifulSoup från paketet bs4.
  • Tilldela den aktuella URL:en till variabeln url.
  • Skicka förfrågan till URL:en och fånga svaret med funktionen requests.get() i ett enda steg – tilldela svaret till variabeln r.
  • Använd attributet text hos objektet r för att hämta webbsidans HTML som en sträng och lagra resultatet i variabeln html_doc.
  • Skapa ett BeautifulSoup-objekt soup från den hämtade HTML-koden med funktionen BeautifulSoup().
  • Använd metoden prettify()soup och tilldela resultatet till pretty_soup.
  • Klicka på Skicka in svar för att skriva ut den formaterade HTML-koden i din terminal!

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
Redigera och kör kod