Розбір HTML за допомогою BeautifulSoup
У цій інтерактивній вправі ви навчитеся використовувати пакет BeautifulSoup, щоб розбирати (parse), форматувати (prettify) та витягувати інформацію з HTML. Ви здійсните скрейпінг даних зі сторінки Ґвідо ван Россума, Benevolent Dictator for Life Python.
Цікавий URL: url = 'https://www.python.org/~guido/'.
Ця вправа є частиною курсу
Середній рівень імпортування даних у Python
Інструкції до вправи
- Імпортуйте функцію
BeautifulSoupз пакетаbs4. - Присвойте потрібний URL змінній
url. - Сформуйте запит до URL, надішліть його і отримайте відповідь однією функцією
requests.get(), присвоївши відповідь зміннійr. - Використайте атрибут
textоб'єктаr, щоб повернути HTML вебсторінки як рядок; збережіть результат у зміннійhtml_doc. - Створіть об'єкт BeautifulSoup
soupз отриманого HTML за допомогою функціїBeautifulSoup(). - Застосуйте метод
prettify()доsoupі присвойте результат зміннійpretty_soup. - Натисніть Submit (Надіслати), щоб вивести відформатований HTML у вашу оболонку!
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)