Aan de slagBegin gratis

Embed-kosten inschatten met tiktoken

Nu we een database en collectie hebben gemaakt om de Netflix-films en -series op te slaan, kunnen we data gaan embedden.

Voordat je een grote gegevensset embedt, is het belangrijk om eerst een kosteninschatting te maken, zodat je binnen je budget blijft. Omdat OpenAI-modellen prijzen op basis van het aantal ingevoerde tokens, gebruiken we OpenAI's tiktoken-bibliotheek om het aantal tokens te tellen en om te rekenen naar dollarkosten.

Je hebt documents gekregen, een lijst met alle data die je wilt embedden. Je gaat over de lijst itereren, elk document encoden en het totale aantal tokens tellen. Tot slot gebruik je de modelprijs om dit om te zetten naar een kostprijs.

Deze oefening maakt deel uit van de cursus

Introductie tot Embeddings met de OpenAI API

Bekijk cursus

Oefeninstructies

  • Laad de encoder voor het model text-embedding-3-small.
  • Encode elke tekst in documents en tel de uitkomst op om het totale aantal tokens in de gegevensset te vinden, total_tokens.
  • Print het totale aantal tokens en de kosten van die tokens met behulp van de cost_per_1k_tokens van het model, die voor je is gedefinieerd.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
Code bewerken en uitvoeren