Kom igångKom igång gratis

Läsa in PDF-filer för RAG

För att börja implementera Retrieval Augmented Generation (RAG) behöver du först läsa in de dokument som modellen ska ha tillgång till. Dokumenten kan komma från många olika källor, och LangChain har stöd för dokumentladdare för en stor del av dem.

I den här övningen använder du en dokumentladdare för att läsa in ett PDF-dokument med artikeln Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks av Lewis m.fl. (2021). Filen finns tillgänglig som 'rag_paper.pdf'.

Obs: pypdf, ett beroende för att läsa in PDF-dokument i LangChain, är redan installerat.

Den här övningen är en del av kursen

Retrieval Augmented Generation (RAG) med LangChain

Visa kurs

Övningsinstruktioner

  • Importera lämplig klass för att läsa in PDF-dokument i LangChain.
  • Skapa en dokumentladdare för dokumentet 'rag_paper.pdf'.
  • Läs in dokumentet i minnet för att visa innehållet i det första dokumentet, det vill säga den första sidan.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import library
from langchain_community.document_loaders import ____

# Create a document loader for rag_paper.pdf
loader = ____

# Load the document
data = ____
print(data[0])
Redigera och kör kod