Bắt đầu với ChromaDB
Trong các bài tập tiếp theo, bạn sẽ dùng một vector database để nhúng (embed) và truy vấn 1000 phim và chương trình TV từ bộ dữ liệu Netflix đã được giới thiệu trong video. Mục tiêu là dùng dữ liệu này để tạo gợi ý dựa trên một truy vấn tìm kiếm. Để bắt đầu, bạn sẽ tạo cơ sở dữ liệu và collection để lưu trữ dữ liệu.
chromadb đã sẵn sàng để bạn sử dụng, và OpenAIEmbeddingFunction() đã được import từ chromadb.utils.embedding_functions. Cũng như hai chương đầu, bạn không cần cung cấp OpenAI API key trong chương này.
Bài tập này là một phần của khóa học
Nhập môn Embeddings với OpenAI API
Hướng dẫn bài tập
- Tạo một persistent client để lưu các tệp cơ sở dữ liệu xuống đĩa; bạn có thể bỏ qua đường dẫn tệp trong các bài tập này.
- Tạo một collection tên
netflix_titlestrong cơ sở dữ liệu, sử dụng hàm OpenAI embedding. - Liệt kê tất cả các collection trong cơ sở dữ liệu.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a persistant client
client = chromadb.____()
# Create a netflix_title collection using the OpenAI Embedding function
collection = client.create_collection(
name="____",
____=____(model_name="text-embedding-3-small", api_key="")
)
# List the collections
print(client.____())