Bắt đầu ngayBắt đầu miễn phí

Biến một trang web thành dữ liệu với BeautifulSoup: lấy văn bản

Như đã hứa, trong các bài tập sau, bạn sẽ học những điều cơ bản để trích xuất thông tin từ HTML soup. Ở bài này, bạn sẽ tìm cách lấy phần văn bản từ trang của BDFL, đồng thời in ra tiêu đề của trang.

Bài tập này là một phần của khóa học

Nhập dữ liệu nâng cao trong Python

Xem khóa học

Hướng dẫn bài tập

  • Trong mã mẫu, đối tượng phản hồi HTML html_doc đã được tạo sẵn: nhiệm vụ đầu tiên của bạn là chuyển nó thành Soup bằng hàm BeautifulSoup() và gán soup thu được cho biến soup.
  • Trích xuất tiêu đề từ HTML soup soup bằng thuộc tính title và gán kết quả cho guido_title.
  • In tiêu đề trang web của Guido ra shell bằng hàm print().
  • Trích xuất văn bản từ HTML soup soup bằng phương thức get_text() và gán cho guido_text.
  • Nhấn Gửi để in văn bản từ trang web của Guido ra shell.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import packages
import requests
from bs4 import BeautifulSoup

# Specify url: url
url = 'https://www.python.org/~guido/'

# Package the request, send the request and catch the response: r
r = requests.get(url)

# Extract the response as html: html_doc
html_doc = r.text

# Create a BeautifulSoup object from the HTML: soup


# Get the title of Guido's webpage: guido_title


# Print the title of Guido's webpage to the shell


# Get Guido's text: guido_text


# Print Guido's text to the shell
print(guido_text)
Chỉnh sửa và Chạy Mã