Načítání PDF dokumentů
Než začneš implementovat Retrieval Augmented Generation (RAG), budeš nejprve potřebovat načíst dokumenty, ke kterým bude mít model přístup. Tyto dokumenty mohou pocházet z různých zdrojů a LangChain podporuje načítače dokumentů pro mnohé z nich.
V tomto cvičení použiješ načítač dokumentů k načtení PDF souboru obsahujícího článek RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture od Balaguera a kol. (2024).
Poznámka: pypdf, závislost potřebná pro načítání PDF dokumentů v LangChainu, je již nainstalována.
Toto cvičení je součástí kurzu
Vývoj LLM aplikací s LangChain
Pokyny k cvičení
- Importuj příslušnou třídu pro načítání PDF dokumentů v LangChainu.
- Vytvoř načítač dokumentů pro soubor
'rag_vs_fine_tuning.pdf', který je dostupný v aktuálním adresáři. - Načti dokument do paměti a zobraz obsah prvního dokumentu, tedy první stránky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])