使用 PyPDF 擷取文字
PyPDF 可讓我們從 PDF 擷取文字,方便處理像是政策手冊這類多頁文件。
在這個練習中,你會載入 US_Employee_Policy.pdf,逐頁擷取內容,並合併為單一字串,為後續的問答(question-answering)pipeline 做好文字準備。
本練習屬於課程
善用 Hugging Face
練習說明
- 從
pypdf匯入所需類別,並用它載入 PDF 檔案。 - 存取每一頁並使用正確的方法擷取頁面內容。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)