Parsarea HTML cu BeautifulSoup
În acest exercițiu interactiv, vei învăța cum să folosești pachetul BeautifulSoup pentru a parsa, formata și extrage informații din HTML. Vei extrage datele de pe pagina web a lui Guido van Rossum, Dictatorul Binevoitor pe Viață al Python-ului. În exercițiile următoare, vei formata HTML-ul și vei extrage textul și hyperlink-urile.
URL-ul de interes este url = 'https://www.python.org/~guido/'.
Acest exercițiu face parte din cursul
Importul intermediar de date în Python
Instrucțiuni pentru exercițiu
- Importă funcția
BeautifulSoupdin pachetulbs4. - Atribuie URL-ul de interes variabilei
url. - Pregătește cererea către URL, trimite cererea și captează răspunsul cu o singură funcție,
requests.get(), atribuind răspunsul variabileir. - Folosește atributul
textal obiectuluirpentru a returna HTML-ul paginii web ca șir de caractere; stochează rezultatul în variabilahtml_doc. - Creează un obiect BeautifulSoup numit
soupdin HTML-ul rezultat, folosind funcțiaBeautifulSoup(). - Aplică metoda
prettify()pesoupși atribuie rezultatul variabileipretty_soup. - Apasă Trimite răspunsul pentru a afișa HTML-ul formatat în consolă!
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)