Transformer une page Web en données avec BeautifulSoup : extraire le texte
Comme promis, dans les prochains exercices, vous allez apprendre les bases de l'extraction d'information à partir d'une soupe HTML. Dans cet exercice, vous verrez comment extraire le texte de la page Web du BDFL et afficher le titre de la page.
Cette activité fait partie du cours
Importation intermédiaire de données en Python
Instructions de l’exercice
- Dans l'exemple de code, l'objet de réponse HTML
html_doca déjà été créé : votre première tâche est de le convertir en « soupe » avec la fonctionBeautifulSoup()et d'assigner la soupe résultante à la variablesoup. - Extrayez le titre de la soupe HTML
soupà l'aide de l'attributtitleet assignez le résultat àguido_title. - Affichez le titre de la page Web de Guido dans le terminal à l'aide de la fonction
print(). - Extrayez le texte de la soupe HTML
soupà l'aide de la méthodeget_text()et assignez-le àguido_text. - Cliquez sur Soumettre la réponse pour afficher le texte de la page Web de Guido dans le terminal.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)