始める無料で始める

PDF ドキュメントローダー

RAG(検索拡張生成)の実装を始めるには、まずモデルが参照するドキュメントを読み込む必要があります。ドキュメントはさまざまなソースから取得でき、LangChain はその多くに対応したドキュメントローダーを提供しています。

この演習では、ドキュメントローダーを使用して、Balaguer et al.(2024)による論文RAG VS ファインチューニング:パイプライン、トレードオフ、および農業に関するケーススタディを含むPDFドキュメントを読み込みます。

注意: pypdf は、LangChain で PDF ドキュメントを読み込むために必要な依存ライブラリで、すでにインストール済みです。

この演習はコースの一部です

LangChainを使ったLLMアプリケーション開発

コースを見る

演習の手順

  • LangChain で PDF ドキュメントを読み込むための適切なクラスをインポートします。
  • 現在のディレクトリにある 'rag_vs_fine_tuning.pdf' ドキュメント用のドキュメントローダーを作成します。
  • ドキュメントをメモリに読み込み、最初のドキュメント、またはページの内容を確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import library
from langchain_community.document_loaders import ____

# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____

# Load the document
data = ____
print(data[0])
コードを編集して実行