ПочатиПочніть безкоштовно

Розбір HTML за допомогою BeautifulSoup

У цій інтерактивній вправі ви навчитеся використовувати пакет BeautifulSoup, щоб розбирати (parse), форматувати (prettify) та витягувати інформацію з HTML. Ви здійсните скрейпінг даних зі сторінки Ґвідо ван Россума, Benevolent Dictator for Life Python.

Цікавий URL: url = 'https://www.python.org/~guido/'.

Ця вправа є частиною курсу

Середній рівень імпортування даних у Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функцію BeautifulSoup з пакета bs4.
  • Присвойте потрібний URL змінній url.
  • Сформуйте запит до URL, надішліть його і отримайте відповідь однією функцією requests.get(), присвоївши відповідь змінній r.
  • Використайте атрибут text об'єкта r, щоб повернути HTML вебсторінки як рядок; збережіть результат у змінній html_doc.
  • Створіть об'єкт BeautifulSoup soup з отриманого HTML за допомогою функції BeautifulSoup().
  • Застосуйте метод prettify() до soup і присвойте результат змінній pretty_soup.
  • Натисніть Submit (Надіслати), щоб вивести відформатований HTML у вашу оболонку!

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
Редагувати та запускати код