เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ Parse HTML ด้วย BeautifulSoup

ในแบบฝึกหัดนี้ คุณจะได้เรียนรู้วิธีใช้แพ็กเกจ BeautifulSoup เพื่อ parse, prettify และ ดึงข้อมูล จาก HTML โดยจะทำการ scrape ข้อมูลจากหน้าเว็บของ Guido van Rossum ผู้สร้างภาษา Python และดำรงตำแหน่ง Benevolent Dictator for Life ในแบบฝึกหัดถัดไป คุณจะได้จัดรูปแบบ HTML แล้วดึงข้อความและไฮเปอร์ลิงก์ออกมา

URL ที่ใช้คือ url = 'https://www.python.org/~guido/'

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การนำเข้าข้อมูลด้วย Python ระดับกลาง

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้าฟังก์ชัน BeautifulSoup จากแพ็กเกจ bs4
  • กำหนด URL ที่ต้องการให้กับตัวแปร url
  • ส่งคำขอไปยัง URL และรับการตอบกลับด้วยฟังก์ชันเดียวคือ requests.get() แล้วเก็บผลลัพธ์ไว้ในตัวแปร r
  • ใช้แอตทริบิวต์ text ของออบเจกต์ r เพื่อดึง HTML ของหน้าเว็บในรูปแบบ string แล้วเก็บผลลัพธ์ไว้ในตัวแปร html_doc
  • สร้างออบเจกต์ BeautifulSoup ชื่อ soup จาก HTML ที่ได้ โดยใช้ฟังก์ชัน BeautifulSoup()
  • เรียกใช้เมธอด prettify() กับ soup แล้วเก็บผลลัพธ์ไว้ในตัวแปร pretty_soup
  • กด ส่งคำตอบ เพื่อพิมพ์ HTML ที่จัดรูปแบบแล้วออกมาใน shell

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import packages
import requests
from ____ import ____

# Specify url: url


# Package the request, send the request and catch the response: r


# Extracts the response as html: html_doc


# Create a BeautifulSoup object from the HTML: soup


# Prettify the BeautifulSoup object: pretty_soup


# Print the response
print(pretty_soup)
แก้ไขและรันโค้ด