tiktoken ile embedding maliyetini tahmin etme
Artık Netflix filmleri ve TV programlarını saklamak için bir veritabanı ve koleksiyon oluşturduğumuza göre, verileri embedding etmeye başlayabiliriz.
Büyük bir veri kümesini embedding etmeden önce, bütçeyi aşmamak için bir maliyet tahmini yapmak önemlidir. OpenAI modelleri girilen token sayısına göre fiyatlandığı için, token sayısını hesaplamak ve bunu dolar maliyetine çevirmek üzere OpenAI'nin tiktoken kütüphanesini kullanacağız.
Sana tüm embedding edilecek verileri içeren bir liste olan documents verildi. Bu liste üzerinde döngü kuracak, her belgeyi encode edecek ve toplam token sayısını hesaplayacaksın. Son olarak, modelin fiyatlandırmasını kullanarak bunu bir maliyete dönüştüreceksin.
Bu egzersiz, kursun bir parçasıdır
OpenAI API ile Embeddings’e Giriş
Egzersiz talimatları
text-embedding-3-smallmodeli için encoder'ı yükle.documentsiçindeki her metni encode et ve sonuçları toplayarak veri kümesindeki toplam token sayısını,total_tokens, bul.- Toplam token sayısını ve bu token'ların maliyetini, senin için tanımlanmış modelin
cost_per_1k_tokensdeğeriyle hesaplayıp yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)