PDF 文件載入器
在開始實作 Retrieval Augmented Generation(RAG)之前,你需要先把模型要存取的文件載入進來。這些文件可能來自多種來源,而 LangChain 對其中許多來源都提供了文件載入器。
在這個練習中,你會使用文件載入器,讀取一份 PDF 文件,內容為 Balaguer 等人於 2024 年發表的論文《RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture》。
注意:用於在 LangChain 中載入 PDF 的相依套件 pypdf 已為你安裝完成。
本練習屬於課程
使用 LangChain 開發 LLM 應用
練習說明
- 匯入用於在 LangChain 載入 PDF 文件的適當類別。
- 為目前目錄中的
'rag_vs_fine_tuning.pdf'建立一個文件載入器。 - 將文件載入記憶體,並檢視第一個文件(或頁面)的內容。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])