शुरू करेंमुफ़्त में शुरू करें

टेक्स्ट डेटासेट को टोकनाइज़ करें

आप एक ट्रैवल वेबसाइट के लिए मार्केट रिसर्च पर काम कर रहे हैं और ऐसे मौजूदा डेटासेट का उपयोग करना चाहते हैं ताकि एक मॉडल को फाइन-ट्यून किया जा सके, जो होटल रिव्यूज़ को क्लासिफ़ाई करने में आपकी मदद करेगा. आप datasets लाइब्रेरी इस्तेमाल करने का निर्णय लेते हैं.

transformers से AutoTokenizer क्लास और datasets से load_dataset() पहले से इम्पोर्ट किए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • टेक्स्ट को बराबर आकार के बैचों में प्रोसेस करने के लिए tokenizer में padding जोड़ें.
  • प्री-ट्रेंड GPT tokenizer और परिभाषित फंक्शन का उपयोग करके टेक्स्ट डेटा को टोकनाइज़ करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

dataset = load_dataset("argilla/tripadvisor-hotel-reviews")

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Add padding with the pad token
tokenizer.____

def tokenize_function(examples):
   return tokenizer(examples["text"], padding="max_length", truncation=True)

# Tokenize the dataset
tokenized_datasets = dataset.map(____, batched=True)
कोड संपादित करें और चलाएँ