Omvandla en webbsida till data med BeautifulSoup: hämta texten
Som utlovat kommer du i de kommande övningarna att lära dig grunderna i att extrahera information från HTML-soppa. I den här övningen tar du reda på hur du extraherar texten från BDFL:s webbsida och skriver ut sidans titel.
Den här övningen är en del av kursen
Importera data i Python – fortsättningskurs
Övningsinstruktioner
- I exempelkoden har HTML-svarsobjektet
html_docredan skapats: din första uppgift är att behandla det med funktionenBeautifulSoup()och tilldela den resulterande soppen till variabelnsoup. - Extrahera titeln från HTML-soppen
soupmed hjälp av attributettitleoch tilldela resultatet tillguido_title. - Skriv ut titeln på Guidos webbsida i konsolen med funktionen
print(). - Extrahera texten från HTML-soppen
soupmed metodenget_text()och tilldela den tillguido_text. - Klicka på Skicka in svar för att skriva ut texten från Guidos webbsida i konsolen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)