Inizia subitoInizia gratis

Stima dei costi degli embedding con tiktoken

Ora che abbiamo creato un database e una collezione per archiviare film e serie TV di Netflix, possiamo iniziare a creare gli embedding dei dati.

Prima di generare embedding per un grande insieme di dati, è importante stimare i costi, così da non sforare il budget. Poiché i modelli OpenAI sono tariffati in base al numero di token in input, useremo la libreria tiktoken di OpenAI per contare i token e convertirli in un costo in dollari.

Ti è stato fornito documents, un elenco che contiene tutti i dati da convertire in embedding. Itererai sulla lista, codificherai ogni documento e conterai il numero totale di token. Infine, userai il prezzo del modello per convertirlo in un costo.

Questo esercizio fa parte del corso

Introduzione agli Embeddings con l'API di OpenAI

Visualizza corso

Istruzioni dell'esercizio

  • Carica l’encoder per il modello text-embedding-3-small.
  • Codifica ogni testo in documents e somma il risultato per ottenere il numero totale di token nel dataset, total_tokens.
  • Stampa il numero totale di token e il costo di quei token usando cost_per_1k_tokens del modello, già definito per te.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
Modifica ed esegui il codice