Začněte nyníZačněte zdarma

Převod webové stránky na data pomocí BeautifulSoup: získávání hypertextových odkazů

V tomto cvičení zjistíš, jak z webové stránky BDFLa extrahovat URL adresy hypertextových odkazů. Při tom se dobře skamarádíš s metodou find_all() z knihovny BeautifulSoup.

Toto cvičení je součástí kurzu

Intermediate Importing Data in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí metody find_all() najdi všechny hypertextové odkazy v objektu soup — pamatuj, že hypertextové odkazy jsou definovány HTML tagem <a>, který se ale do find_all() předává bez ostrých závorek. Výsledek ulož do proměnné a_tags.
  • Proměnná a_tags je množina výsledků: tvým úkolem je projít ji pomocí for smyčky a vypsat skutečné URL adresy odkazů. Pro každý prvek link v a_tags zavolej print() s argumentem link.get('href').

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extracts the response as html: html_doc
html_doc = r.text

# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)

# Print the title of Guido's webpage
print(soup.title)

# Find all 'a' tags (which define hyperlinks): a_tags


# Print the URLs to the shell
for ____ in ____:
    ____
Upravit a spustit kód