Zacznij terazZacznij za darmo

Zamiana strony internetowej w dane za pomocą BeautifulSoup: pobieranie tekstu

Zgodnie z zapowiedzią, w kolejnych ćwiczeniach poznasz podstawy wyodrębniania informacji z HTML soup. W tym ćwiczeniu dowiesz się, jak wyodrębnić tekst ze strony BDFL-a oraz jak wydrukować jej tytuł.

To ćwiczenie jest częścią kursu

Importowanie danych w Pythonie – poziom średniozaawansowany

Zobacz kurs

Instrukcje do ćwiczenia

  • W przykładowym kodzie obiekt odpowiedzi HTML html_doc został już utworzony: twoim pierwszym zadaniem jest przetworzenie go za pomocą funkcji BeautifulSoup() i przypisanie wynikowej zupy do zmiennej soup.
  • Wyodrębnij tytuł z HTML soup soup, korzystając z atrybutu title, i przypisz wynik do guido_title.
  • Wydrukuj tytuł strony Guido w konsoli, używając funkcji print().
  • Wyodrębnij tekst z HTML soup soup, korzystając z metody get_text(), i przypisz go do guido_text.
  • Kliknij Prześlij odpowiedź, aby wydrukować tekst ze strony Guido w konsoli.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Edytuj i uruchom kod