Uppskatta inbäddningskostnader med tiktoken
Nu när vi har skapat en databas och en samling för att lagra Netflix-filmer och TV-serier kan vi börja bädda in data.
Innan du bäddar in en stor datamängd är det viktigt att göra en kostnadsuppskattning för att undvika att överskrida din budget. Eftersom OpenAI:s modeller prissätts utifrån antalet inmatade tokens använder vi OpenAI:s bibliotek tiktoken för att räkna antalet tokens och omvandla dem till en kostnad i dollar.
Du har tillgång till documents, en lista med all data som ska bäddas in. Du itererar över listan, kodar varje dokument och räknar det totala antalet tokens. Slutligen använder du modellens prissättning för att omvandla detta till en kostnad.
Den här övningen är en del av kursen
Introduktion till inbäddningar med OpenAI API
Övningsinstruktioner
- Läs in enkodaren för modellen
text-embedding-3-small. - Koda varje text i
documentsoch summera resultatet för att beräkna det totala antalet tokens i datamängden,total_tokens. - Skriv ut det totala antalet tokens och kostnaden för dessa tokens med hjälp av modellens
cost_per_1k_tokens, som redan är definierad åt dig.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)