Osadzanie i przechowywanie dokumentów
Ostatnim krokiem w przygotowaniu dokumentów do wyszukiwania jest ich osadzenie i przechowanie. Do osadzania podzielonych fragmentów dokumentów użyjesz modelu text-embedding-3-small od OpenAI, a następnie zapiszesz je w lokalnej wektorowej bazie danych Chroma.
Fragmenty chunks powstałe z rekurencyjnego podziału artykułu Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks zostały już wczytane.
W tym ćwiczeniu nie musisz tworzyć ani używać własnego klucza API OpenAI. Możesz pozostawić placeholder <OPENAI_API_TOKEN> — zostanie on użyty do wysłania poprawnych żądań do API OpenAI.
To ćwiczenie jest częścią kursu
Retrieval Augmented Generation (RAG) z LangChain
Instrukcje do ćwiczenia
- Zainicjalizuj domyślny model osadzania (embeddings) od OpenAI.
- Osadź fragmenty dokumentów
chunksza pomocąembedding_modeli zapisz je w wektorowej bazie danych Chroma.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Initialize the OpenAI embedding model
embedding_model = ____(api_key="", model='text-embedding-3-small')
# Create a Chroma vector store and embed the chunks
vector_store = ____