เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ประมาณค่าใช้จ่ายของ embedding ด้วย tiktoken

หลังจากสร้างฐานข้อมูลและ collection สำหรับเก็บข้อมูลภาพยนตร์และรายการทีวีของ Netflix แล้ว ตอนนี้เราจะเริ่มสร้าง embedding จากข้อมูลเหล่านั้น

ก่อนจะสร้าง embedding จากชุดข้อมูลขนาดใหญ่ ควรประมาณค่าใช้จ่ายล่วงหน้าเพื่อให้แน่ใจว่าไม่เกินงบประมาณที่กำหนด เนื่องจากโมเดลของ OpenAI คิดราคาตามจำนวน token ที่ป้อนเข้า เราจะใช้ไลบรารี tiktoken ของ OpenAI เพื่อนับจำนวน token แล้วแปลงเป็นค่าใช้จ่ายในหน่วยดอลลาร์

ตัวแปร documents ที่เตรียมไว้ให้คือ list ที่บรรจุข้อมูลทั้งหมดที่จะนำไปสร้าง embedding จากนั้นจะวนซ้ำผ่าน list นี้ เข้ารหัสแต่ละ document และนับจำนวน token ทั้งหมด สุดท้ายจะนำราคาของโมเดลมาแปลงเป็นค่าใช้จ่าย

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การสร้าง Embeddings ด้วย OpenAI API

ดูคอร์ส

คำแนะนำการฝึกหัด

  • โหลด encoder สำหรับโมเดล text-embedding-3-small
  • เข้ารหัสข้อความแต่ละรายการใน documents แล้วรวมผลลัพธ์เพื่อหาจำนวน token ทั้งหมดในชุดข้อมูล ซึ่งก็คือ total_tokens
  • แสดงจำนวน token ทั้งหมดและค่าใช้จ่ายของ token เหล่านั้น โดยใช้ cost_per_1k_tokens ที่กำหนดไว้ให้แล้ว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")

# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)

cost_per_1k_tokens = 0.00002

# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)
แก้ไขและรันโค้ด