Transformarea unei pagini web în date cu BeautifulSoup: extragerea textului
Așa cum am promis, în exercițiile următoare vei învăța elementele de bază ale extragerii informațiilor din supa HTML. În acest exercițiu, vei descoperi cum să extragi textul de pe pagina web a BDFL, împreună cu afișarea titlului acesteia.
Acest exercițiu face parte din cursul
Importul intermediar de date în Python
Instrucțiuni pentru exercițiu
- În codul exemplu, obiectul răspuns HTML
html_doca fost deja creat: prima ta sarcină este să îl transformi în supă folosind funcțiaBeautifulSoup()și să atribui supa rezultată variabileisoup. - Extrage titlul din supa HTML
soupfolosind atributultitleși atribuie rezultatul variabileiguido_title. - Afișează titlul paginii lui Guido în consolă folosind funcția
print(). - Extrage textul din supa HTML
soupfolosind metodaget_text()și atribuie-l variabileiguido_text. - Apasă Trimite răspunsul pentru a afișa textul de pe pagina lui Guido în consolă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)