PyPDFを使ったテキスト抽出
PyPDFを使うと、PDFからテキストを抽出できます。規定文書のような長いドキュメントも簡単に扱えます。
この演習では、質問応答パイプラインで使えるテキストを準備するため、US_Employee_Policy.pdfを読み込み、ページごとにコンテンツを抽出して1つの文字列にまとめます。
この演習はコースの一部です
Hugging Faceを使いこなす
演習の手順
pypdfから必要なクラスをインポートし、PDFファイルを読み込んでください。- 各ページにアクセスし、適切なメソッドを使ってコンテンツを抽出してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from pypdf import ____
# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")
# Extract text from all pages
document_text = ""
for page in reader.____:
document_text += page.____()
print(document_text)