為 RAG 載入 PDF 檔案
要開始實作 Retrieval Augmented Generation(RAG),你首先需要載入模型將會存取的文件。這些文件可能來自多種來源,而 LangChain 提供了對多種來源的文件載入器支援。
在這個練習中,你會使用文件載入器來載入一份 PDF 文件,內容是 Lewis 等人(2021)的論文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》。這個檔案已提供為 'rag_paper.pdf'。
注意:用於在 LangChain 中載入 PDF 文件的相依套件 pypdf 已經替你安裝好。
本練習屬於課程
使用 LangChain 的 Retrieval Augmented Generation(RAG)
練習說明
- 匯入在 LangChain 中用於載入 PDF 文件的合適類別。
- 為
'rag_paper.pdf'建立一個文件載入器。 - 將文件載入記憶體,查看第一個文件(或頁面)的內容。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_paper.pdf
loader = ____
# Load the document
data = ____
print(data[0])