开始使用免费开始使用

使用 PyPDF 提取文本

PyPDF 可以从 PDF 中提取文本,便于处理如政策文档这类多页文件。

在本练习中,您将加载 US_Employee_Policy.pdf,逐页提取其内容,并将其合并为一个字符串,为后续的问题解答(question-answering)pipeline 做好文本准备。

本练习是课程的一部分

使用 Hugging Face

查看课程

练习说明

  • pypdf 导入所需的类并用它加载 PDF 文件。
  • 访问每一页,并使用正确的方法提取其内容。

交互式实操练习

通过完成这段示例代码来试试这个练习。

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
编辑并运行代码