ÎncepețiÎncepe gratuit

Transformarea unei pagini web în date cu BeautifulSoup: extragerea textului

Așa cum am promis, în exercițiile următoare vei învăța elementele de bază ale extragerii informațiilor din supa HTML. În acest exercițiu, vei descoperi cum să extragi textul de pe pagina web a BDFL, împreună cu afișarea titlului acesteia.

Acest exercițiu face parte din cursul

Importul intermediar de date în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • În codul exemplu, obiectul răspuns HTML html_doc a fost deja creat: prima ta sarcină este să îl transformi în supă folosind funcția BeautifulSoup() și să atribui supa rezultată variabilei soup.
  • Extrage titlul din supa HTML soup folosind atributul title și atribuie rezultatul variabilei guido_title.
  • Afișează titlul paginii lui Guido în consolă folosind funcția print().
  • Extrage textul din supa HTML soup folosind metoda get_text() și atribuie-l variabilei guido_text.
  • Apasă Trimite răspunsul pentru a afișa textul de pe pagina lui Guido în consolă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Editează și rulează codul