Преобразование веб-страницы в данные с помощью BeautifulSoup: извлечение текста
В следующих упражнениях вы освоите основы извлечения информации из HTML-супа. В этом упражнении вы научитесь извлекать текст со страницы БДФЛ, а также выводить заголовок этой страницы.
Это упражнение является частью курса
Импорт данных в Python: средний уровень
Инструкции к упражнению
- В примере кода объект HTML-ответа
html_docуже создан. Ваша первая задача — преобразовать его с помощью функцииBeautifulSoup()и сохранить результат в переменнуюsoup. - Извлеките заголовок из HTML-супа
soup, используя атрибутtitle, и сохраните результат в переменнуюguido_title. - Выведите заголовок веб-страницы Гвидо в консоль с помощью функции
print(). - Извлеките текст из HTML-супа
soup, применив методget_text(), и сохраните результат в переменнуюguido_text. - Нажмите «Отправить ответ», чтобы вывести текст со страницы Гвидо в консоль.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)