Bắt đầu ngayBắt đầu miễn phí

Trích xuất văn bản với PyPDF

PyPDF cho phép bạn trích xuất văn bản từ PDF, giúp làm việc dễ dàng với các tài liệu nhiều trang như các tệp chính sách.

Trong bài tập này, bạn sẽ tải US_Employee_Policy.pdf, trích xuất nội dung theo từng trang và gộp lại thành một chuỗi duy nhất, chuẩn bị văn bản cho pipeline hỏi-đáp.

Bài tập này là một phần của khóa học

Làm việc với Hugging Face

Xem khóa học

Hướng dẫn bài tập

  • Import lớp cần thiết từ pypdf và dùng nó để tải tệp PDF.
  • Truy cập từng trang và trích xuất nội dung bằng phương thức phù hợp.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
Chỉnh sửa và Chạy Mã