Kom igångKom igång gratis

Omvandla en webbsida till data med BeautifulSoup: hämta hyperlänkar

I den här övningen tar du reda på hur du extraherar URL:er från hyperlänkarna på BDFL:s webbsida. Under resans gång lär du känna soup-metoden find_all() på djupet.

Den här övningen är en del av kursen

Importera data i Python – fortsättningskurs

Visa kurs

Övningsinstruktioner

  • Använd metoden find_all() för att hitta alla hyperlänkar i soup. Kom ihåg att hyperlänkar definieras av HTML-taggen <a>, men skickas till find_all() utan vinkelparenteser. Spara resultatet i variabeln a_tags.
  • Variabeln a_tags är en resultatmängd. Din uppgift är nu att iterera över den med en for-loop och skriva ut de faktiska URL:erna för hyperlänkarna. Gör det genom att för varje element link i a_tags anropa print() med link.get('href').

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extracts the response as html: html_doc
html_doc = r.text

# create a BeautifulSoup object from the HTML: soup
soup = BeautifulSoup(html_doc)

# Print the title of Guido's webpage
print(soup.title)

# Find all 'a' tags (which define hyperlinks): a_tags


# Print the URLs to the shell
for ____ in ____:
    ____
Redigera och kör kod