Začněte nyníZačněte zdarma

Převod webové stránky na data pomocí BeautifulSoup: získání textu

Jak bylo slíbeno, v následujících cvičeních se naučíš základy extrakce informací z HTML soup. V tomto cvičení zjistíš, jak získat text z webové stránky BDFL a jak vypsat její název.

Toto cvičení je součástí kurzu

Intermediate Importing Data in Python

Zobrazit kurz

Pokyny k cvičení

  • V ukázkovém kódu byl objekt HTML response html_doc již připraven: tvým prvním úkolem je zpracovat ho pomocí funkce BeautifulSoup() a výsledný soup přiřadit do proměnné soup.
  • Extrahuj název z HTML soup soup pomocí atributu title a výsledek přiřaď do guido_title.
  • Vypiš název Guidovy webové stránky do shellu pomocí funkce print().
  • Extrahuj text z HTML soup soup pomocí metody get_text() a přiřaď ho do guido_text.
  • Klikni na Submit a vypiš text z Guidovy webové stránky do shellu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Upravit a spustit kód