AutoTokenizer के साथ टेक्स्ट प्रीप्रोसेस करें
आप एक प्रिसीजन एग्रीकल्चर एप्लिकेशन बना रहे हैं ताकि किसान खेत में आने वाली समस्याओं पर प्रश्न पूछ सकें। आप किसानों द्वारा झेली जाने वाली समस्याओं से जुड़े सामान्य प्रश्नों और उत्तरों के एक डेटासेट का उपयोग करेंगे; इस डेटासेट में ये फील्ड हैं:
question: कृषि से जुड़े सामान्य प्रश्नanswers: उन प्रश्नों के उत्तर
डिस्ट्रिब्यूटेड ट्रेनिंग के पहले चरण के रूप में, आप इस टेक्स्ट डेटासेट का प्रीप्रोसेसिंग शुरू करेंगे.
कुछ डेटा पहले से लोड किया गया है:
datasetमें कृषि से जुड़े प्रश्नों और उत्तरों का एक सैंपल डेटासेट हैAutoTokenizerकोtransformersसे इम्पोर्ट किया गया है
यह अभ्यास पाठ्यक्रम का हिस्सा है
PyTorch के साथ कुशल AI मॉडल प्रशिक्षण
अभ्यास निर्देश
- एक प्री-ट्रेंड
tokenizerलोड करें. tokenizerका उपयोग करकेexample["question"]को टोकनाइज़ करें.datasetपरencode()फंक्शन अप्लाई करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")
def encode(example):
# Tokenize the "question" field of the training example
return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")
# Map the function to the dataset
dataset = ____.____(____, batched=True)
dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)
print(dataset)