Загрузчики PDF-документов
Чтобы начать реализацию Retrieval Augmented Generation (RAG), сначала нужно загрузить документы, к которым будет обращаться модель. Эти документы могут поступать из самых разных источников, и LangChain поддерживает загрузчики для многих из них.
В этом упражнении вы воспользуетесь загрузчиком документов, чтобы загрузить PDF-файл со статьёй RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture авторства Balaguer et al. (2024).
Примечание: библиотека pypdf, необходимая для загрузки PDF-документов в LangChain, уже установлена.
Это упражнение является частью курса
Разработка LLM-приложений с помощью LangChain
Инструкции к упражнению
- Импортируйте подходящий класс для загрузки PDF-документов в LangChain.
- Создайте загрузчик документов для файла
'rag_vs_fine_tuning.pdf', который находится в текущем каталоге. - Загрузите документ в память и просмотрите содержимое первого документа (страницы).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])