開始使用免費開始

使用 PyPDF 擷取文字

PyPDF 可讓我們從 PDF 擷取文字,方便處理像是政策手冊這類多頁文件。

在這個練習中,你會載入 US_Employee_Policy.pdf,逐頁擷取內容,並合併為單一字串,為後續的問答(question-answering)pipeline 做好文字準備。

本練習屬於課程

善用 Hugging Face

檢視課程

練習說明

  • pypdf 匯入所需類別,並用它載入 PDF 檔案。
  • 存取每一頁並使用正確的方法擷取頁面內容。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
編輯並執行程式碼