BaşlayınÜcretsiz başlayın

tiktoken ile embedding maliyetini tahmin etme

Artık Netflix filmleri ve TV programlarını saklamak için bir veritabanı ve koleksiyon oluşturduğumuza göre, verileri embedding etmeye başlayabiliriz.

Büyük bir veri kümesini embedding etmeden önce, bütçeyi aşmamak için bir maliyet tahmini yapmak önemlidir. OpenAI modelleri girilen token sayısına göre fiyatlandığı için, token sayısını hesaplamak ve bunu dolar maliyetine çevirmek üzere OpenAI'nin tiktoken kütüphanesini kullanacağız.

Sana tüm embedding edilecek verileri içeren bir liste olan documents verildi. Bu liste üzerinde döngü kuracak, her belgeyi encode edecek ve toplam token sayısını hesaplayacaksın. Son olarak, modelin fiyatlandırmasını kullanarak bunu bir maliyete dönüştüreceksin.

Bu egzersiz, kursun bir parçasıdır

OpenAI API ile Embeddings’e Giriş

Kursa Göz Atın

Egzersiz talimatları

  • text-embedding-3-small modeli için encoder'ı yükle.
  • documents içindeki her metni encode et ve sonuçları toplayarak veri kümesindeki toplam token sayısını, total_tokens, bul.
  • Toplam token sayısını ve bu token'ların maliyetini, senin için tanımlanmış modelin cost_per_1k_tokens değeriyle hesaplayıp yazdır.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
Kodu Düzenle ve Çalıştır