文件的嵌入與儲存
為了讓文件可以被擷取,最後一步是進行嵌入向量與儲存。你將使用 OpenAI 的 text-embedding-3-small 模型來為分塊後的文件建立嵌入向量,並將它們儲存在本機的 Chroma 向量資料庫中。
你先前以遞迴方式對 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks 論文進行切分所產生的 chunks,已經預先載入。
本練習不需要建立或使用 OpenAI 的 API 金鑰。 你可以保留 <OPENAI_API_TOKEN> 這個佔位符,它會向 OpenAI API 送出可用的請求。
本練習屬於課程
使用 LangChain 的 Retrieval Augmented Generation(RAG)
練習說明
- 初始化 OpenAI 的預設嵌入向量模型。
- 使用
embedding_model對文件的chunks進行嵌入,並將其儲存在 Chroma 向量資料庫中。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Initialize the OpenAI embedding model
embedding_model = ____(api_key="", model='text-embedding-3-small')
# Create a Chroma vector store and embed the chunks
vector_store = ____