Převod webové stránky na data pomocí BeautifulSoup: získání textu
Jak bylo slíbeno, v následujících cvičeních se naučíš základy extrakce informací z HTML soup. V tomto cvičení zjistíš, jak získat text z webové stránky BDFL a jak vypsat její název.
Toto cvičení je součástí kurzu
Intermediate Importing Data in Python
Pokyny k cvičení
- V ukázkovém kódu byl objekt HTML response
html_docjiž připraven: tvým prvním úkolem je zpracovat ho pomocí funkceBeautifulSoup()a výsledný soup přiřadit do proměnnésoup. - Extrahuj název z HTML soup
souppomocí atribututitlea výsledek přiřaď doguido_title. - Vypiš název Guidovy webové stránky do shellu pomocí funkce
print(). - Extrahuj text z HTML soup
souppomocí metodyget_text()a přiřaď ho doguido_text. - Klikni na Submit a vypiš text z Guidovy webové stránky do shellu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)