НачатьНачать бесплатно

Загрузка PDF-файлов для RAG

Чтобы приступить к реализации Retrieval Augmented Generation (RAG), сначала необходимо загрузить документы, к которым будет обращаться модель. Источники таких документов могут быть самыми разными — LangChain поддерживает загрузчики для многих из них.

В этом упражнении вы воспользуетесь загрузчиком документов, чтобы загрузить PDF-файл со статьёй Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks авторства Lewis et al. (2021). Файл доступен вам под именем 'rag_paper.pdf'.

Примечание: библиотека pypdf, необходимая для загрузки PDF-документов в LangChain, уже установлена.

Это упражнение является частью курса

Retrieval Augmented Generation (RAG) с LangChain

Посмотреть курс

Инструкции к упражнению

  • Импортируйте подходящий класс для загрузки PDF-документов в LangChain.
  • Создайте загрузчик документа для файла 'rag_paper.pdf'.
  • Загрузите документ в память, чтобы просмотреть содержимое первого документа (страницы).

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import library
from langchain_community.document_loaders import ____

# Create a document loader for rag_paper.pdf
loader = ____

# Load the document
data = ____
print(data[0])
Редактировать и запускать код