開始使用免費開始

為 RAG 載入 PDF 檔案

要開始實作 Retrieval Augmented Generation(RAG),你首先需要載入模型將會存取的文件。這些文件可能來自多種來源,而 LangChain 提供了對多種來源的文件載入器支援。

在這個練習中,你會使用文件載入器來載入一份 PDF 文件,內容是 Lewis 等人(2021)的論文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》。這個檔案已提供為 'rag_paper.pdf'

注意:用於在 LangChain 中載入 PDF 文件的相依套件 pypdf 已經替你安裝好。

本練習屬於課程

使用 LangChain 的 Retrieval Augmented Generation(RAG)

檢視課程

練習說明

  • 匯入在 LangChain 中用於載入 PDF 文件的合適類別。
  • 'rag_paper.pdf' 建立一個文件載入器。
  • 將文件載入記憶體,查看第一個文件(或頁面)的內容。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import library
from langchain_community.document_loaders import ____

# Create a document loader for rag_paper.pdf
loader = ____

# Load the document
data = ____
print(data[0])
編輯並執行程式碼