การสร้าง Embedding และจัดเก็บเอกสาร
ขั้นตอนสุดท้ายในการเตรียมเอกสารสำหรับการดึงข้อมูลคือการสร้าง embedding และจัดเก็บเอกสาร โดยจะใช้โมเดล text-embedding-3-small จาก OpenAI สำหรับสร้าง embedding ให้กับชิ้นส่วนเอกสาร และจัดเก็บไว้ในฐานข้อมูลเวกเตอร์ Chroma แบบโลคัล
chunks ที่ได้จากการแบ่งเอกสาร Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks แบบ recursive ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้ไม่จำเป็นต้องสร้างหรือใช้ OpenAI API key สามารถเว้น <OPENAI_API_TOKEN> ไว้เป็น placeholder ได้เลย ซึ่งจะส่งคำขอที่ถูกต้องไปยัง OpenAI API โดยอัตโนมัติ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Retrieval Augmented Generation (RAG) ด้วย LangChain
คำแนะนำการฝึกหัด
- กำหนดค่าโมเดล embedding เริ่มต้นจาก OpenAI
- สร้าง embedding จาก
chunksของเอกสารโดยใช้embedding_modelและจัดเก็บไว้ในฐานข้อมูลเวกเตอร์ Chroma
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Initialize the OpenAI embedding model
embedding_model = ____(api_key="", model='text-embedding-3-small')
# Create a Chroma vector store and embed the chunks
vector_store = ____