使用 PyPDF 提取文本
PyPDF 可以从 PDF 中提取文本,便于处理如政策文档这类多页文件。
在本练习中,您将加载 US_Employee_Policy.pdf,逐页提取其内容,并将其合并为一个字符串,为后续的问题解答(question-answering)pipeline 做好文本准备。
本练习是课程的一部分
使用 Hugging Face
练习说明
- 从
pypdf导入所需的类并用它加载 PDF 文件。 - 访问每一页,并使用正确的方法提取其内容。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)