Загрузка PDF-файлов для RAG
Чтобы приступить к реализации Retrieval Augmented Generation (RAG), сначала необходимо загрузить документы, к которым будет обращаться модель. Источники таких документов могут быть самыми разными — LangChain поддерживает загрузчики для многих из них.
В этом упражнении вы воспользуетесь загрузчиком документов, чтобы загрузить PDF-файл со статьёй Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks авторства Lewis et al. (2021). Файл доступен вам под именем 'rag_paper.pdf'.
Примечание: библиотека pypdf, необходимая для загрузки PDF-документов в LangChain, уже установлена.
Это упражнение является частью курса
Retrieval Augmented Generation (RAG) с LangChain
Инструкции к упражнению
- Импортируйте подходящий класс для загрузки PDF-документов в LangChain.
- Создайте загрузчик документа для файла
'rag_paper.pdf'. - Загрузите документ в память, чтобы просмотреть содержимое первого документа (страницы).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_paper.pdf
loader = ____
# Load the document
data = ____
print(data[0])