เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การดึงข้อความด้วย PyPDF

PyPDF ช่วยให้ดึงข้อความจาก PDF ได้สะดวก เหมาะสำหรับเอกสารหลายหน้า เช่น ไฟล์นโยบายต่างๆ

ในแบบฝึกหัดนี้ จะโหลดไฟล์ US_Employee_Policy.pdf ดึงเนื้อหาทีละหน้า แล้วรวมทุกหน้าเข้าเป็น string เดียว เพื่อเตรียมข้อความสำหรับ pipeline ตอบคำถาม

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การใช้งาน Hugging Face

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import class ที่จำเป็นจาก pypdf แล้วใช้โหลดไฟล์ PDF
  • เข้าถึงแต่ละหน้าและดึงเนื้อหาออกมาโดยใช้ method ที่ถูกต้อง

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
แก้ไขและรันโค้ด