始める無料で始める

PyPDFを使ったテキスト抽出

PyPDFを使うと、PDFからテキストを抽出できます。規定文書のような長いドキュメントも簡単に扱えます。

この演習では、質問応答パイプラインで使えるテキストを準備するため、US_Employee_Policy.pdfを読み込み、ページごとにコンテンツを抽出して1つの文字列にまとめます。

この演習はコースの一部です

Hugging Faceを使いこなす

コースを見る

演習の手順

  • pypdfから必要なクラスをインポートし、PDFファイルを読み込んでください。
  • 各ページにアクセスし、適切なメソッドを使ってコンテンツを抽出してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from pypdf import ____

# Extract text from the PDF
reader = ____("US_Employee_Policy.pdf")

# Extract text from all pages
document_text = ""
for page in reader.____: 
    document_text += page.____()

print(document_text)
コードを編集して実行