Phân tích HTML với BeautifulSoup
Trong bài tập tương tác này, bạn sẽ học cách dùng gói BeautifulSoup để parse, prettify và trích xuất thông tin từ HTML. Bạn sẽ thu thập dữ liệu từ trang web của Guido van Rossum, Benevolent Dictator for Life của chính Python. Ở các bước tiếp theo, bạn sẽ làm đẹp HTML rồi trích xuất phần văn bản và các siêu liên kết.
URL cần quan tâm là url = 'https://www.python.org/~guido/'.
Bài tập này là một phần của khóa học
Nhập dữ liệu nâng cao trong Python
Hướng dẫn bài tập
- Import hàm
BeautifulSouptừ góibs4. - Gán URL cần lấy vào biến
url. - Đóng gói yêu cầu đến URL, gửi yêu cầu và nhận phản hồi chỉ với một hàm
requests.get(), gán phản hồi cho biếnr. - Dùng thuộc tính
textcủa đối tượngrđể lấy HTML của trang web dưới dạng chuỗi; lưu kết quả vào biếnhtml_doc. - Tạo một đối tượng BeautifulSoup
souptừ HTML thu được bằng hàmBeautifulSoup(). - Dùng phương thức
prettify()trênsoupvà gán kết quả chopretty_soup. - Nhấn Gửi để in HTML đã được làm đẹp ra shell của bạn!
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import packages
import requests
from ____ import ____
# Specify url: url
# Package the request, send the request and catch the response: r
# Extracts the response as html: html_doc
# Create a BeautifulSoup object from the HTML: soup
# Prettify the BeautifulSoup object: pretty_soup
# Print the response
print(pretty_soup)