Chargeurs de documents PDF
Pour commencer à mettre en place la génération augmentée par la recherche (RAG), vous devez d'abord charger les documents auxquels le modèle aura accès. Ces documents peuvent provenir de plusieurs sources, et LangChain prend en charge des chargeurs de documents pour bon nombre d'entre elles.
Dans cet exercice, vous utiliserez un chargeur de documents pour charger un fichier PDF contenant l'article « RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture » de Balaguer et coll. (2024).
Remarque : pypdf, une dépendance utilisée pour charger des documents PDF dans LangChain, est déjà installée pour vous.
Cette activité fait partie du cours
Développer des applications LLM avec LangChain
Instructions de l’exercice
- Importez la classe appropriée pour charger des documents PDF dans LangChain.
- Créez un chargeur de document pour le fichier
'rag_vs_fine_tuning.pdf', disponible dans le répertoire courant. - Chargez le document en mémoire pour afficher le contenu du premier document, ou de la première page.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])