Analyser du HTML avec BeautifulSoup
Dans cet exercice interactif, vous apprendrez à utiliser le paquet BeautifulSoup pour analyser, mettre en forme et extraire de l'information à partir de HTML. Vous récupérerez des données à partir de la page Web de Guido van Rossum, le Benevolent Dictator for Life de Python. Dans les exercices suivants, vous mettrez en forme le HTML, puis vous en extrairez le texte et les hyperliens.
L'URL qui nous intéresse est url = 'https://www.python.org/~guido/'.
Cette activité fait partie du cours
Importation intermédiaire de données en Python
Instructions de l’exercice
- Importez la fonction
BeautifulSoupdu paquetbs4. - Assignez l'URL visée à la variable
url. - Préparez la requête vers l'URL, envoyez-la et interceptez la réponse avec une seule fonction
requests.get(), en assignant la réponse à la variabler. - Utilisez l'attribut
textde l'objetrpour obtenir le HTML de la page Web sous forme de chaîne; stockez le résultat dans une variablehtml_doc. - Créez un objet BeautifulSoup
soupà partir du HTML obtenu en utilisant la fonctionBeautifulSoup(). - Utilisez la méthode
prettify()sursoupet assignez le résultat àpretty_soup. - Cliquez sur Soumettre la réponse pour imprimer le HTML mis en forme dans votre interpréteur !
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)