शुरू करेंमुफ़्त में शुरू करें

रिवॉर्ड इनिशियलाइज़ करना

आप एक जेनेरेटिव मॉडल को डिप्लॉय करने के अंतिम चरण में हैं, जो एक ऑनलाइन बुकस्टोर के लिए पर्सनलाइज़्ड रिकमेंडेशन देता है। इस मॉडल को मानव-पसंदीदा रिकमेंडेशन के अनुरूप लाने के लिए, आपको कुछ इकट्ठा किए गए प्रेफरेंस डेटा से एक रिवॉर्ड मॉडल ट्रेन करना होगा। पहला कदम है मॉडल और कॉन्फ़िगरेशन पैरामीटर्स को इनिशियलाइज़ करना।

transformers से AutoTokenizer और AutoModelForSequenceClassification पहले से लोड किए गए हैं। trl से RewardConfig भी पहले से लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Hugging Face के AutoModelForSequenceClassification का उपयोग करते हुए सीक्वेंस क्लासिफिकेशन टास्क के लिए GPT-1 मॉडल "openai-gpt" लोड करें.
  • रिवॉर्ड कॉन्फ़िगरेशन इनिशियलाइज़ करें: आउटपुट डायरेक्टरी के रूप में "output_dir" का उपयोग करें, और टोकन की अधिकतम लंबाई 60 सेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
कोड संपादित करें और चलाएँ