Перетворення вебсторінки на дані за допомогою BeautifulSoup: отримання тексту
Як і обіцяли, у наступних вправах ви навчитеся основам видобування інформації з HTML‑супу. У цій вправі ви з'ясуєте, як отримати текст зі сторінки BDFL, а також надрукувати заголовок сторінки.
Ця вправа є частиною курсу
Середній рівень імпортування даних у Python
Інструкції до вправи
- У зразку коду HTML-об'єкт відповіді
html_docуже створено: ваше перше завдання — перетворити його на «суп» за допомогою функціїBeautifulSoup()і присвоїти отриманий суп зміннійsoup. - Витягніть заголовок із HTML‑супу
soup, використавши атрибутtitle, і присвойте результат зміннійguido_title. - Надрукуйте заголовок вебсторінки Ґвідо в консолі за допомогою функції
print(). - Витягніть текст із HTML‑супу
soup, використавши методget_text(), і присвойте зміннійguido_text. - Натисніть Надіслати, щоб надрукувати текст зі сторінки Ґвідо в консолі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)