PDF ドキュメントローダー
RAG(検索拡張生成)の実装を始めるには、まずモデルが参照するドキュメントを読み込む必要があります。ドキュメントはさまざまなソースから取得でき、LangChain はその多くに対応したドキュメントローダーを提供しています。
この演習では、ドキュメントローダーを使用して、Balaguer et al.(2024)による論文RAG VS ファインチューニング:パイプライン、トレードオフ、および農業に関するケーススタディを含むPDFドキュメントを読み込みます。
注意: pypdf は、LangChain で PDF ドキュメントを読み込むために必要な依存ライブラリで、すでにインストール済みです。
この演習はコースの一部です
LangChainを使ったLLMアプリケーション開発
演習の手順
- LangChain で PDF ドキュメントを読み込むための適切なクラスをインポートします。
- 現在のディレクトリにある
'rag_vs_fine_tuning.pdf'ドキュメント用のドキュメントローダーを作成します。 - ドキュメントをメモリに読み込み、最初のドキュメント、またはページの内容を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])