ПочатиПочніть безкоштовно

Перетворення вебсторінки на дані за допомогою BeautifulSoup: отримання тексту

Як і обіцяли, у наступних вправах ви навчитеся основам видобування інформації з HTML‑супу. У цій вправі ви з'ясуєте, як отримати текст зі сторінки BDFL, а також надрукувати заголовок сторінки.

Ця вправа є частиною курсу

Середній рівень імпортування даних у Python

Переглянути курс

Інструкції до вправи

  • У зразку коду HTML-об'єкт відповіді html_doc уже створено: ваше перше завдання — перетворити його на «суп» за допомогою функції BeautifulSoup() і присвоїти отриманий суп змінній soup.
  • Витягніть заголовок із HTML‑супу soup, використавши атрибут title, і присвойте результат змінній guido_title.
  • Надрукуйте заголовок вебсторінки Ґвідо в консолі за допомогою функції print().
  • Витягніть текст із HTML‑супу soup, використавши метод get_text(), і присвойте змінній guido_text.
  • Натисніть Надіслати, щоб надрукувати текст зі сторінки Ґвідо в консолі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Редагувати та запускати код