Разбор HTML с помощью BeautifulSoup
В этом интерактивном упражнении вы научитесь использовать пакет BeautifulSoup для разбора, форматирования и извлечения информации из HTML. Вы будете извлекать данные со страницы Гвидо ван Россума — создателя Python и его пожизненного великодушного диктатора. В следующих упражнениях вы отформатируете HTML, а затем извлечёте текст и гиперссылки.
Интересующий нас URL: url = 'https://www.python.org/~guido/'.
Это упражнение является частью курса
Импорт данных в Python: средний уровень
Инструкции к упражнению
- Импортируйте функцию
BeautifulSoupиз пакетаbs4. - Присвойте нужный URL переменной
url. - Сформируйте запрос к URL, отправьте его и получите ответ с помощью единственной функции
requests.get(), сохранив результат в переменнуюr. - Используйте атрибут
textобъектаr, чтобы получить HTML страницы в виде строки, и сохраните результат в переменнуюhtml_doc. - Создайте объект BeautifulSoup
soupиз полученного HTML с помощью функцииBeautifulSoup(). - Примените метод
prettify()к объектуsoupи сохраните результат в переменнуюpretty_soup. - Нажмите «Отправить ответ», чтобы вывести отформатированный HTML в консоль!
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)