RAG用のPDFファイルの読み込み
検索拡張生成(RAG)の実装を始めるには、まずモデルがアクセスするドキュメントを読み込む必要があります。ドキュメントの取得元はさまざまですが、LangChainなら多彩な入力形式に応じたローダーを利用できます。
この演習では、ドキュメントローダーを使って、Lewisら(2021年)による論文 Retrieval-Augmented Generation for Knowledge-Intensive NLP TasksのPDFファイルを読み込みましょう。このファイルは'rag_paper.pdf'という名前がつけられています。
注:LangChainでPDFファイルを読み込む際に必要になるpypdf は、すでにインストール済みです。
この演習はコースの一部です
LangChainで学ぶ検索拡張生成(RAG)
演習の手順
- LangChainでPDFファイルを読み込むための適切なクラスをインポートしてください。
'rag_paper.pdf'ファイル用のドキュメントローダーを作成してください。- ドキュメントをメモリに読み込み、最初のドキュメント(またはページ)の内容を確認してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_paper.pdf
loader = ____
# Load the document
data = ____
print(data[0])