tiktoken के साथ embedding लागत का अनुमान
अब जब हमने Netflix फिल्मों और TV शोज़ को स्टोर करने के लिए एक डेटाबेस और कलेक्शन बना लिया है, तो हम डेटा को एम्बेड करना शुरू कर सकते हैं.
किसी बड़े डेटासेट को एम्बेड करने से पहले, लागत का अनुमान लगाना ज़रूरी है ताकि आप किसी बजट सीमा से ऊपर न जाएँ. क्योंकि OpenAI मॉडल्स की कीमत इनपुट किए गए टोकन्स की संख्या के आधार पर होती है, इसलिए हम OpenAI की tiktoken लाइब्रेरी का उपयोग करके टोकन्स की संख्या गिनेंगे और उन्हें डॉलर लागत में बदलेंगे.
आपको documents दिया गया है, जो एम्बेड किए जाने वाले सभी डेटा की एक सूची है. आप इस सूची पर इटररेट करेंगे, प्रत्येक डॉक्युमेंट को एन्कोड करेंगे, और टोकन्स की कुल संख्या गिनेंगे. अंत में, आप मॉडल की प्राइसिंग का उपयोग करके इसे लागत में बदलेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
OpenAI API के साथ Embeddings परिचय
अभ्यास निर्देश
text-embedding-3-smallमॉडल के लिए एन्कोडर लोड करें.documentsके प्रत्येक टेक्स्ट को एन्कोड करें, और परिणामों का योग लेकर डेटासेट में टोकन्स की कुल संख्याtotal_tokensनिकालें.- टोकन्स की कुल संख्या और उनकी लागत को, आपके लिए परिभाषित मॉडल के
cost_per_1k_tokensका उपयोग करके, प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the encoder for the OpenAI text-embedding-3-small model
enc = tiktoken.encoding_for_model("____")
# Encode each text in documents and calculate the total tokens
total_tokens = ____(____(____) for ____ in documents)
cost_per_1k_tokens = 0.00002
# Display number of tokens and cost
print('Total tokens:', ____)
print('Cost:', ____)