Завантаження PDF-файлів для RAG
Щоб почати реалізацію Retrieval Augmented Generation (RAG), спершу потрібно завантажити документи, до яких звертатиметься модель. Ці документи можуть надходити з різних джерел, і LangChain підтримує завантажувачі документів для багатьох із них.
У цій вправі ви скористаєтеся завантажувачем документів, щоб завантажити PDF із науковою статтею „Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks" авторства Lewis та ін. (2021). Цей файл доступний для вас під назвою 'rag_paper.pdf'.
Примітка: pypdf, залежність для завантаження PDF-документів у LangChain, уже інстальовано для вас.
Ця вправа є частиною курсу
Retrieval Augmented Generation (RAG) з LangChain
Інструкції до вправи
- Імпортуйте відповідний клас для завантаження PDF-документів у LangChain.
- Створіть завантажувач документа для файлу
'rag_paper.pdf'. - Завантажте документ у памʼять, щоб переглянути вміст першого документа, тобто сторінки.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_paper.pdf
loader = ____
# Load the document
data = ____
print(data[0])