Odhad nákladů na embedding pomocí tiktoken
Teď, když máme vytvořenou databázi a kolekci pro ukládání filmů a seriálů z Netflixu, můžeme začít s embeddingem dat.
Před zpracováním velkého datasetu je důležité odhadnout náklady, abychom nepřekročili rozpočet. Protože OpenAI modely se účtují podle počtu vstupních tokenů, použijeme knihovnu tiktoken od OpenAI k jejich spočítání a převodu na cenu v dolarech.
Máš k dispozici proměnnou documents — seznam se všemi daty určenými k embeddingu. Projdeš celý seznam, zakóduješ každý dokument a spočítáš celkový počet tokenů. Nakonec pomocí ceníku modelu převedeš výsledek na konkrétní náklady.
Toto cvičení je součástí kurzu
Introduction to Embeddings with the OpenAI API
Pokyny k cvičení
- Načti enkodér pro model
text-embedding-3-small. - Zakóduj každý text v
documentsa sečti výsledky, abys získal/a celkový počet tokenů v datasetu —total_tokens. - Vypiš celkový počet tokenů a odpovídající náklady s využitím hodnoty
cost_per_1k_tokens, která je pro tebe předem definovaná.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)