ÎncepețiÎncepe gratuit

Transformarea unei pagini web în date cu BeautifulSoup: extragerea hyperlink-urilor

În acest exercițiu, vei descoperi cum să extragi URL-urile hyperlink-urilor de pe pagina web a BDFL. Pe parcurs, vei deveni un bun cunoscător al metodei find_all() din BeautifulSoup.

Acest exercițiu face parte din cursul

Importul intermediar de date în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește metoda find_all() pentru a găsi toate hyperlink-urile din soup, ținând cont că hyperlink-urile sunt definite de tag-ul HTML <a>, dar se transmit către find_all() fără paranteze unghiulare; stochează rezultatul în variabila a_tags.
  • Variabila a_tags este un set de rezultate: sarcina ta acum este să o parcurgi cu o buclă for și să afișezi URL-urile efective ale hyperlink-urilor; pentru asta, pentru fiecare element link din a_tags, apelează print() cu link.get('href').

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extracts the response as html: html_doc
html_doc = r.text

# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)

# Print the title of Guido's webpage
print(soup.title)

# Find all 'a' tags (which define hyperlinks): a_tags


# Print the URLs to the shell
for ____ in ____:
    ____
Editează și rulează codul