Estimarea costurilor de încorporare cu tiktoken
Acum că am creat o bază de date și o colecție pentru a stoca filmele și serialele Netflix, putem începe procesul de încorporare a datelor.
Înainte de a încorpora un set de date mare, este important să estimezi costurile, pentru a te asigura că nu depășești bugetul disponibil. Deoarece modelele OpenAI sunt facturate în funcție de numărul de tokeni de intrare, vom folosi biblioteca tiktoken de la OpenAI pentru a număra tokenii și a-i converti într-un cost în dolari.
Ăți este pus la dispoziție documents, o listă care conține toate datele de încorporat. Vei itera prin listă, vei codifica fiecare document și vei număra numărul total de tokeni. În final, vei folosi prețul modelului pentru a converti acest număr într-un cost.
Acest exercițiu face parte din cursul
Introducere în Embeddings cu API-ul OpenAI
Instrucțiuni pentru exercițiu
- Încarcă encoder-ul pentru modelul
text-embedding-3-small. - Codifică fiecare text din
documentsși sumează rezultatele pentru a afla numărul total de tokeni din setul de date,total_tokens. - Afișează numărul total de tokeni și costul acestora, folosind valoarea
cost_per_1k_tokensdefinită pentru tine.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)