Перетворення вебсторінки на дані за допомогою BeautifulSoup: отримання гіперпосилань
У цій вправі ви з'ясуєте, як витягти URL-адреси гіперпосилань зі сторінки BDFL. Під час цього ви добре познайомитеся з методом супу find_all().
Ця вправа є частиною курсу
Середній рівень імпортування даних у Python
Інструкції до вправи
- Скористайтеся методом
find_all()щоби знайти всі гіперпосилання вsoup, пам'ятаючи, що гіперпосилання визначаються HTML‑тегом<a>, але передаються вfind_all()без кутових дужок; збережіть результат у зміннійa_tags. - Змінна
a_tags— це набір результатів: тепер ваше завдання — пройтися по ньому за допомогою циклуforі вивести фактичні URL‑адреси гіперпосилань; для цього для кожного елементаlinkуa_tagsпотрібно виконатиprint()зlink.get('href').
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extracts the response as html: html_doc
html_doc = r.text
# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)
# Print the title of Guido's webpage
print(soup.title)
# Find all 'a' tags (which define hyperlinks): a_tags
# Print the URLs to the shell
for ____ in ____:
____