Zamiana strony internetowej w dane za pomocą BeautifulSoup: pobieranie tekstu
Zgodnie z zapowiedzią, w kolejnych ćwiczeniach poznasz podstawy wyodrębniania informacji z HTML soup. W tym ćwiczeniu dowiesz się, jak wyodrębnić tekst ze strony BDFL-a oraz jak wydrukować jej tytuł.
To ćwiczenie jest częścią kursu
Importowanie danych w Pythonie – poziom średniozaawansowany
Instrukcje do ćwiczenia
- W przykładowym kodzie obiekt odpowiedzi HTML
html_doczostał już utworzony: twoim pierwszym zadaniem jest przetworzenie go za pomocą funkcjiBeautifulSoup()i przypisanie wynikowej zupy do zmiennejsoup. - Wyodrębnij tytuł z HTML soup
soup, korzystając z atrybututitle, i przypisz wynik doguido_title. - Wydrukuj tytuł strony Guido w konsoli, używając funkcji
print(). - Wyodrębnij tekst z HTML soup
soup, korzystając z metodyget_text(), i przypisz go doguido_text. - Kliknij Prześlij odpowiedź, aby wydrukować tekst ze strony Guido w konsoli.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)