ประมาณค่าใช้จ่ายของ embedding ด้วย tiktoken
หลังจากสร้างฐานข้อมูลและ collection สำหรับเก็บข้อมูลภาพยนตร์และรายการทีวีของ Netflix แล้ว ตอนนี้เราจะเริ่มสร้าง embedding จากข้อมูลเหล่านั้น
ก่อนจะสร้าง embedding จากชุดข้อมูลขนาดใหญ่ ควรประมาณค่าใช้จ่ายล่วงหน้าเพื่อให้แน่ใจว่าไม่เกินงบประมาณที่กำหนด เนื่องจากโมเดลของ OpenAI คิดราคาตามจำนวน token ที่ป้อนเข้า เราจะใช้ไลบรารี tiktoken ของ OpenAI เพื่อนับจำนวน token แล้วแปลงเป็นค่าใช้จ่ายในหน่วยดอลลาร์
ตัวแปร documents ที่เตรียมไว้ให้คือ list ที่บรรจุข้อมูลทั้งหมดที่จะนำไปสร้าง embedding จากนั้นจะวนซ้ำผ่าน list นี้ เข้ารหัสแต่ละ document และนับจำนวน token ทั้งหมด สุดท้ายจะนำราคาของโมเดลมาแปลงเป็นค่าใช้จ่าย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้าง Embeddings ด้วย OpenAI API
คำแนะนำการฝึกหัด
- โหลด encoder สำหรับโมเดล
text-embedding-3-small - เข้ารหัสข้อความแต่ละรายการใน
documentsแล้วรวมผลลัพธ์เพื่อหาจำนวน token ทั้งหมดในชุดข้อมูล ซึ่งก็คือtotal_tokens - แสดงจำนวน token ทั้งหมดและค่าใช้จ่ายของ token เหล่านั้น โดยใช้
cost_per_1k_tokensที่กำหนดไว้ให้แล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)