शुरू करेंमुफ़्त में शुरू करें

AutoTokenizer के साथ टेक्स्ट प्रीप्रोसेस करें

आप एक प्रिसीजन एग्रीकल्चर एप्लिकेशन बना रहे हैं ताकि किसान खेत में आने वाली समस्याओं पर प्रश्न पूछ सकें। आप किसानों द्वारा झेली जाने वाली समस्याओं से जुड़े सामान्य प्रश्नों और उत्तरों के एक डेटासेट का उपयोग करेंगे; इस डेटासेट में ये फील्ड हैं:

  • question: कृषि से जुड़े सामान्य प्रश्न
  • answers: उन प्रश्नों के उत्तर

डिस्ट्रिब्यूटेड ट्रेनिंग के पहले चरण के रूप में, आप इस टेक्स्ट डेटासेट का प्रीप्रोसेसिंग शुरू करेंगे.

कुछ डेटा पहले से लोड किया गया है:

  • dataset में कृषि से जुड़े प्रश्नों और उत्तरों का एक सैंपल डेटासेट है
  • AutoTokenizer को transformers से इम्पोर्ट किया गया है

यह अभ्यास पाठ्यक्रम का हिस्सा है

PyTorch के साथ कुशल AI मॉडल प्रशिक्षण

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक प्री-ट्रेंड tokenizer लोड करें.
  • tokenizer का उपयोग करके example["question"] को टोकनाइज़ करें.
  • dataset पर encode() फंक्शन अप्लाई करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load a pre-trained tokenizer
tokenizer = ____.____("distilbert-base-uncased")

def encode(example):
    # Tokenize the "question" field of the training example
    return ____(____["____"], padding="max_length", truncation=True, return_tensors="pt")

# Map the function to the dataset
dataset = ____.____(____, batched=True)

dataset = dataset.map(lambda example: {"labels": example["answers"]}, batched=True)

print(dataset)
कोड संपादित करें और चलाएँ