Trích xuất văn bản với PyPDF
PyPDF cho phép bạn trích xuất văn bản từ PDF, giúp làm việc dễ dàng với các tài liệu nhiều trang như các tệp chính sách.
Trong bài tập này, bạn sẽ tải US_Employee_Policy.pdf, trích xuất nội dung theo từng trang và gộp lại thành một chuỗi duy nhất, chuẩn bị văn bản cho pipeline hỏi-đáp.
Bài tập này là một phần của khóa học
Làm việc với Hugging Face
Hướng dẫn bài tập
- Import lớp cần thiết từ
pypdfvà dùng nó để tải tệp PDF. - Truy cập từng trang và trích xuất nội dung bằng phương thức phù hợp.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)