Embed-kosten inschatten met tiktoken
Nu we een database en collectie hebben gemaakt om de Netflix-films en -series op te slaan, kunnen we data gaan embedden.
Voordat je een grote gegevensset embedt, is het belangrijk om eerst een kosteninschatting te maken, zodat je binnen je budget blijft. Omdat OpenAI-modellen prijzen op basis van het aantal ingevoerde tokens, gebruiken we OpenAI's tiktoken-bibliotheek om het aantal tokens te tellen en om te rekenen naar dollarkosten.
Je hebt documents gekregen, een lijst met alle data die je wilt embedden. Je gaat over de lijst itereren, elk document encoden en het totale aantal tokens tellen. Tot slot gebruik je de modelprijs om dit om te zetten naar een kostprijs.
Deze oefening maakt deel uit van de cursus
Introductie tot Embeddings met de OpenAI API
Oefeninstructies
- Laad de encoder voor het model
text-embedding-3-small. - Encode elke tekst in
documentsen tel de uitkomst op om het totale aantal tokens in de gegevensset te vinden,total_tokens. - Print het totale aantal tokens en de kosten van die tokens met behulp van de
cost_per_1k_tokensvan het model, die voor je is gedefinieerd.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)