Оценка стоимости эмбеддингов с помощью tiktoken
Теперь, когда мы создали базу данных и коллекцию для хранения фильмов и сериалов Netflix, можно приступить к созданию эмбеддингов.
Перед тем как обрабатывать большой набор данных, важно оценить предстоящие затраты, чтобы не выйти за рамки бюджета. Поскольку модели OpenAI тарифицируются по количеству входных токенов, воспользуемся библиотекой tiktoken от OpenAI, чтобы подсчитать токены и перевести их количество в денежную стоимость.
Вам предоставлен список documents, содержащий все данные для создания эмбеддингов. Вы пройдёте по этому списку, закодируете каждый документ и подсчитаете общее количество токенов. После этого воспользуетесь тарифами модели, чтобы перевести результат в стоимость.
Это упражнение является частью курса
Введение в эмбеддинги с OpenAI API
Инструкции к упражнению
- Загрузите энкодер для модели
text-embedding-3-small. - Закодируйте каждый текст из
documentsи просуммируйте результаты, чтобы найти общее количество токенов в наборе данных —total_tokens. - Выведите общее количество токенов и их стоимость, используя значение
cost_per_1k_tokens, которое уже определено для вас.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)