ÎncepețiÎncepe gratuit

Estimarea costurilor de încorporare cu tiktoken

Acum că am creat o bază de date și o colecție pentru a stoca filmele și serialele Netflix, putem începe procesul de încorporare a datelor.

Înainte de a încorpora un set de date mare, este important să estimezi costurile, pentru a te asigura că nu depășești bugetul disponibil. Deoarece modelele OpenAI sunt facturate în funcție de numărul de tokeni de intrare, vom folosi biblioteca tiktoken de la OpenAI pentru a număra tokenii și a-i converti într-un cost în dolari.

Ăți este pus la dispoziție documents, o listă care conține toate datele de încorporat. Vei itera prin listă, vei codifica fiecare document și vei număra numărul total de tokeni. În final, vei folosi prețul modelului pentru a converti acest număr într-un cost.

Acest exercițiu face parte din cursul

Introducere în Embeddings cu API-ul OpenAI

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă encoder-ul pentru modelul text-embedding-3-small.
  • Codifică fiecare text din documents și sumează rezultatele pentru a afla numărul total de tokeni din setul de date, total_tokens.
  • Afișează numărul total de tokeni și costul acestora, folosind valoarea cost_per_1k_tokens definită pentru tine.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
Editează și rulează codul