Biến một trang web thành dữ liệu với BeautifulSoup: lấy văn bản
Như đã hứa, trong các bài tập sau, bạn sẽ học những điều cơ bản để trích xuất thông tin từ HTML soup. Ở bài này, bạn sẽ tìm cách lấy phần văn bản từ trang của BDFL, đồng thời in ra tiêu đề của trang.
Bài tập này là một phần của khóa học
Nhập dữ liệu nâng cao trong Python
Hướng dẫn bài tập
- Trong mã mẫu, đối tượng phản hồi HTML
html_docđã được tạo sẵn: nhiệm vụ đầu tiên của bạn là chuyển nó thành Soup bằng hàmBeautifulSoup()và gán soup thu được cho biếnsoup. - Trích xuất tiêu đề từ HTML soup
soupbằng thuộc tínhtitlevà gán kết quả choguido_title. - In tiêu đề trang web của Guido ra shell bằng hàm
print(). - Trích xuất văn bản từ HTML soup
soupbằng phương thứcget_text()và gán choguido_text. - Nhấn Gửi để in văn bản từ trang web của Guido ra shell.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import packages
import requests
from bs4 import BeautifulSoup
# Specify url: url
url = 'https://www.python.org/~guido/'
# Package the request, send the request and catch the response: r
r = requests.get(url)
# Extract the response as html: html_doc
html_doc = r.text
# Create a BeautifulSoup object from the HTML: soup
# Get the title of Guido's webpage: guido_title
# Print the title of Guido's webpage to the shell
# Get Guido's text: guido_text
# Print Guido's text to the shell
print(guido_text)