Создание эмбеддингов и сохранение документов
Последний шаг подготовки документов к поиску — создание эмбеддингов (векторных представлений) и их сохранение. Вы будете использовать модель text-embedding-3-small от OpenAI для создания эмбеддингов фрагментов документов и сохранять их в локальной векторной базе данных Chroma.
Фрагменты chunks, полученные рекурсивным разбиением статьи Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, уже загружены заранее.
Создавать и использовать ключ OpenAI API в этом упражнении не требуется. Вы можете оставить заполнитель <OPENAI_API_TOKEN> — он обеспечит корректные запросы к OpenAI API.
Это упражнение является частью курса
Retrieval Augmented Generation (RAG) с LangChain
Инструкции к упражнению
- Инициализируйте модель эмбеддингов OpenAI, используемую по умолчанию.
- Создайте эмбеддинги фрагментов документов
chunksс помощьюembedding_modelи сохраните их в векторной базе данных Chroma.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize the OpenAI embedding model
embedding_model = ____(api_key="", model='text-embedding-3-small')
# Create a Chroma vector store and embed the chunks
vector_store = ____