Kom igångKom igång gratis

Omvandla en webbsida till data med BeautifulSoup: hämta texten

Som utlovat kommer du i de kommande övningarna att lära dig grunderna i att extrahera information från HTML-soppa. I den här övningen tar du reda på hur du extraherar texten från BDFL:s webbsida och skriver ut sidans titel.

Den här övningen är en del av kursen

Importera data i Python – fortsättningskurs

Visa kurs

Övningsinstruktioner

  • I exempelkoden har HTML-svarsobjektet html_doc redan skapats: din första uppgift är att behandla det med funktionen BeautifulSoup() och tilldela den resulterande soppen till variabeln soup.
  • Extrahera titeln från HTML-soppen soup med hjälp av attributet title och tilldela resultatet till guido_title.
  • Skriv ut titeln på Guidos webbsida i konsolen med funktionen print().
  • Extrahera texten från HTML-soppen soup med metoden get_text() och tilldela den till guido_text.
  • Klicka på Skicka in svar för att skriva ut texten från Guidos webbsida i konsolen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Redigera och kör kod