ÎncepețiÎncepe gratuit

Parsarea HTML cu BeautifulSoup

În acest exercițiu interactiv, vei învăța cum să folosești pachetul BeautifulSoup pentru a parsa, formata și extrage informații din HTML. Vei extrage datele de pe pagina web a lui Guido van Rossum, Dictatorul Binevoitor pe Viață al Python-ului. În exercițiile următoare, vei formata HTML-ul și vei extrage textul și hyperlink-urile.

URL-ul de interes este url = 'https://www.python.org/~guido/'.

Acest exercițiu face parte din cursul

Importul intermediar de date în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcția BeautifulSoup din pachetul bs4.
  • Atribuie URL-ul de interes variabilei url.
  • Pregătește cererea către URL, trimite cererea și captează răspunsul cu o singură funcție, requests.get(), atribuind răspunsul variabilei r.
  • Folosește atributul text al obiectului r pentru a returna HTML-ul paginii web ca șir de caractere; stochează rezultatul în variabila html_doc.
  • Creează un obiect BeautifulSoup numit soup din HTML-ul rezultat, folosind funcția BeautifulSoup().
  • Aplică metoda prettify() pe soup și atribuie rezultatul variabilei pretty_soup.
  • Apasă Trimite răspunsul pentru a afișa HTML-ul formatat în consolă!

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
Editează și rulează codul