การดึงข้อความด้วย PyPDF
PyPDF ช่วยให้ดึงข้อความจาก PDF ได้สะดวก เหมาะสำหรับเอกสารหลายหน้า เช่น ไฟล์นโยบายต่างๆ
ในแบบฝึกหัดนี้ จะโหลดไฟล์ US_Employee_Policy.pdf ดึงเนื้อหาทีละหน้า แล้วรวมทุกหน้าเข้าเป็น string เดียว เพื่อเตรียมข้อความสำหรับ pipeline ตอบคำถาม
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การใช้งาน Hugging Face
คำแนะนำการฝึกหัด
- Import class ที่จำเป็นจาก
pypdfแล้วใช้โหลดไฟล์ PDF - เข้าถึงแต่ละหน้าและดึงเนื้อหาออกมาโดยใช้ method ที่ถูกต้อง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)