Začněte nyníZačněte zdarma

Odhad nákladů na embedding pomocí tiktoken

Teď, když máme vytvořenou databázi a kolekci pro ukládání filmů a seriálů z Netflixu, můžeme začít s embeddingem dat.

Před zpracováním velkého datasetu je důležité odhadnout náklady, abychom nepřekročili rozpočet. Protože OpenAI modely se účtují podle počtu vstupních tokenů, použijeme knihovnu tiktoken od OpenAI k jejich spočítání a převodu na cenu v dolarech.

Máš k dispozici proměnnou documents — seznam se všemi daty určenými k embeddingu. Projdeš celý seznam, zakóduješ každý dokument a spočítáš celkový počet tokenů. Nakonec pomocí ceníku modelu převedeš výsledek na konkrétní náklady.

Toto cvičení je součástí kurzu

Introduction to Embeddings with the OpenAI API

Zobrazit kurz

Pokyny k cvičení

  • Načti enkodér pro model text-embedding-3-small.
  • Zakóduj každý text v documents a sečti výsledky, abys získal/a celkový počet tokenů v datasetu — total_tokens.
  • Vypiš celkový počet tokenů a odpovídající náklady s využitím hodnoty cost_per_1k_tokens, která je pro tebe předem definovaná.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
Upravit a spustit kód