डॉक्युमेंट्स को एम्बेड करना और स्टोर करना
रिट्रीवल के लिए डॉक्युमेंट्स तैयार करने का अंतिम चरण है उन्हें एम्बेड करना और स्टोर करना. आप OpenAI के text-embedding-3-small मॉडल का उपयोग चंक किए गए डॉक्युमेंट्स को एम्बेड करने के लिए करेंगे, और उन्हें लोकल Chroma वेक्टर डेटाबेस में स्टोर करेंगे.
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks पेपर को recursively स्प्लिट करके जो chunks आपने बनाए थे, वे प्री-लोड किए गए हैं.
इस अभ्यास में OpenAI API key बनाना और उपयोग करना आवश्यक नहीं है. आप <OPENAI_API_TOKEN> placeholder को जैसा है वैसा ही छोड़ सकते हैं, जिससे OpenAI API को वैध रिक्वेस्ट्स भेजी जाएँगी.
यह अभ्यास पाठ्यक्रम का हिस्सा है
LangChain के साथ Retrieval Augmented Generation (RAG)
अभ्यास निर्देश
- OpenAI से डिफॉल्ट एम्बेडिंग मॉडल इनिशियलाइज़ करें.
embedding_modelका उपयोग करके डॉक्युमेंटchunksको एम्बेड करें और उन्हें Chroma वेक्टर डेटाबेस में स्टोर करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize the OpenAI embedding model
embedding_model = ____(api_key="", model='text-embedding-3-small')
# Create a Chroma vector store and embed the chunks
vector_store = ____