ПочатиПочніть безкоштовно

Перетворення вебсторінки на дані за допомогою BeautifulSoup: отримання гіперпосилань

У цій вправі ви з'ясуєте, як витягти URL-адреси гіперпосилань зі сторінки BDFL. Під час цього ви добре познайомитеся з методом супу find_all().

Ця вправа є частиною курсу

Середній рівень імпортування даних у Python

Переглянути курс

Інструкції до вправи

  • Скористайтеся методом find_all() щоби знайти всі гіперпосилання в soup, пам'ятаючи, що гіперпосилання визначаються HTML‑тегом <a>, але передаються в find_all() без кутових дужок; збережіть результат у змінній a_tags.
  • Змінна a_tags — це набір результатів: тепер ваше завдання — пройтися по ньому за допомогою циклу for і вивести фактичні URL‑адреси гіперпосилань; для цього для кожного елемента link у a_tags потрібно виконати print() з link.get('href').

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extracts the response as html: html_doc
html_doc = r.text

# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)

# Print the title of Guido's webpage
print(soup.title)

# Find all 'a' tags (which define hyperlinks): a_tags


# Print the URLs to the shell
for ____ in ____:
    ____
Редагувати та запускати код