Bắt đầu ngayBắt đầu miễn phí

Embed và lưu trữ tài liệu

Bước cuối cùng để chuẩn bị tài liệu cho truy xuất là embed và lưu trữ chúng. Bạn sẽ dùng mô hình text-embedding-3-small từ OpenAI để embed các đoạn (chunk) tài liệu và lưu chúng trong cơ sở dữ liệu vector Chroma cục bộ.

Các chunks bạn đã tạo bằng cách tách đệ quy bài báo Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks đã được nạp sẵn.

Trong bài tập này không yêu cầu tạo hoặc dùng OpenAI API key. Bạn có thể giữ nguyên placeholder <OPENAI_API_TOKEN>, yêu cầu này vẫn hợp lệ khi gửi tới OpenAI API.

Bài tập này là một phần của khóa học

Retrieval Augmented Generation (RAG) với LangChain

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo mô hình embedding mặc định từ OpenAI.
  • Embed các chunks tài liệu bằng embedding_model và lưu chúng vào cơ sở dữ liệu vector Chroma.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Initialize the OpenAI embedding model
embedding_model = ____(api_key="", model='text-embedding-3-small')

# Create a Chroma vector store and embed the chunks
vector_store = ____
Chỉnh sửa và Chạy Mã