Mulai sekarangMulai gratis

Mengestimasi biaya embedding dengan tiktoken

Sekarang kita telah membuat database dan koleksi untuk menyimpan film dan acara TV Netflix, kita dapat mulai melakukan embedding data.

Sebelum melakukan embedding pada himpunan data besar, penting untuk membuat estimasi biaya agar Anda tidak melampaui batas anggaran. Karena model OpenAI diberi harga berdasarkan jumlah token yang diinputkan, kita akan menggunakan pustaka tiktoken dari OpenAI untuk menghitung jumlah token dan mengonversinya menjadi biaya dalam dolar.

Anda telah disediakan documents, yaitu sebuah daftar yang memuat semua data yang akan di-embed. Anda akan melakukan iterasi pada daftar tersebut, mengenkode setiap dokumen, dan menghitung total jumlah token. Terakhir, Anda akan menggunakan harga model untuk mengonversinya menjadi biaya.

Latihan ini merupakan bagian dari kursus

Pengantar Embeddings dengan OpenAI API

Lihat Kursus

Instruksi latihan

  • Muat encoder untuk model text-embedding-3-small.
  • Enkode setiap teks dalam documents, lalu jumlahkan hasilnya untuk menemukan total jumlah token dalam himpunan data, total_tokens.
  • Cetak total jumlah token dan biaya token tersebut menggunakan cost_per_1k_tokens milik model yang telah disediakan untuk Anda.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
Edit dan Jalankan Kode