НачатьНачать бесплатно

Преобразование веб-страницы в данные с помощью BeautifulSoup: извлечение текста

В следующих упражнениях вы освоите основы извлечения информации из HTML-супа. В этом упражнении вы научитесь извлекать текст со страницы БДФЛ, а также выводить заголовок этой страницы.

Это упражнение является частью курса

Импорт данных в Python: средний уровень

Посмотреть курс

Инструкции к упражнению

  • В примере кода объект HTML-ответа html_doc уже создан. Ваша первая задача — преобразовать его с помощью функции BeautifulSoup() и сохранить результат в переменную soup.
  • Извлеките заголовок из HTML-супа soup, используя атрибут title, и сохраните результат в переменную guido_title.
  • Выведите заголовок веб-страницы Гвидо в консоль с помощью функции print().
  • Извлеките текст из HTML-супа soup, применив метод get_text(), и сохраните результат в переменную guido_text.
  • Нажмите «Отправить ответ», чтобы вывести текст со страницы Гвидо в консоль.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Редактировать и запускать код