RAGのためにPDFファイルを読み込む
Retrieval Augmented Generation(RAG)を実装するには、まずモデルが参照するドキュメントを読み込む必要があります。これらのドキュメントはさまざまなソースから取得でき、LangChainは多くのソースに対応したドキュメントローダーを提供しています。
この演習では、Lewis ら(2021)の論文「Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks」を含むPDFドキュメントを、ドキュメントローダーで読み込みます。ファイル名は 'rag_paper.pdf' として用意されています。
Note: LangChainでPDFドキュメントを読み込むための依存関係である pypdf は、すでにインストール済みです。
この演習はコースの一部です
LangChain で学ぶ Retrieval Augmented Generation (RAG)
演習の手順
- LangChainでPDFドキュメントを読み込むための適切なクラスをインポートします。
'rag_paper.pdf'用のドキュメントローダーを作成します。- ドキュメントをメモリに読み込み、最初のドキュメント(またはページ)の内容を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_paper.pdf
loader = ____
# Load the document
data = ____
print(data[0])