НачатьНачать бесплатно

Добавление данных в коллекцию

Пришло время добавить фильмы и сериалы Netflix в вашу коллекцию! Вам предоставлены список идентификаторов документов и список текстов, хранящихся в ids и documents соответственно. Они извлечены из файла netflix_titles.csv с помощью следующего кода:

ids = []
documents = []

with open('netflix_titles.csv') as csvfile:
  reader = csv.DictReader(csvfile)
  for i, row in enumerate(reader):
    ids.append(row['show_id'])
    text = f"Title: {row['title']} ({row['type']})\nDescription: {row['description']}\nCategories: {row['listed_in']}"
    documents.append(text)

Для примера — вот первый документ из documents, который будет преобразован в эмбеддинг (векторное представление):

Title: Dick Johnson Is Dead (Movie)
Description: As her father nears the end of his life, filmmaker Kirsten Johnson stages his death in inventive and comical ways to help them both face the inevitable.
Categories: Documentaries

Все необходимые функции и пакеты уже импортированы, а постоянный клиент создан и присвоен переменной client.

Это упражнение является частью курса

Введение в эмбеддинги с OpenAI API

Посмотреть курс

Инструкции к упражнению

  • Пересоздайте коллекцию netflix_titles.
  • Добавьте документы и их идентификаторы в коллекцию.
  • Выведите количество документов в collection и первые десять элементов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Recreate the netflix_titles collection
collection = client.____(
  name="netflix_titles",
  embedding_function=OpenAIEmbeddingFunction(model_name="text-embedding-3-small", api_key="")
)

# Add the documents and IDs to the collection
____

# Print the collection size and first ten items
print(f"No. of documents: {____}")
print(f"First ten documents: {____}")
Редактировать и запускать код