НачатьНачать бесплатно

Разбор HTML с помощью BeautifulSoup

В этом интерактивном упражнении вы научитесь использовать пакет BeautifulSoup для разбора, форматирования и извлечения информации из HTML. Вы будете извлекать данные со страницы Гвидо ван Россума — создателя Python и его пожизненного великодушного диктатора. В следующих упражнениях вы отформатируете HTML, а затем извлечёте текст и гиперссылки.

Интересующий нас URL: url = 'https://www.python.org/~guido/'.

Это упражнение является частью курса

Импорт данных в Python: средний уровень

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию BeautifulSoup из пакета bs4.
  • Присвойте нужный URL переменной url.
  • Сформируйте запрос к URL, отправьте его и получите ответ с помощью единственной функции requests.get(), сохранив результат в переменную r.
  • Используйте атрибут text объекта r, чтобы получить HTML страницы в виде строки, и сохраните результат в переменную html_doc.
  • Создайте объект BeautifulSoup soup из полученного HTML с помощью функции BeautifulSoup().
  • Примените метод prettify() к объекту soup и сохраните результат в переменную pretty_soup.
  • Нажмите «Отправить ответ», чтобы вывести отформатированный HTML в консоль!

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
Редактировать и запускать код