रिवॉर्ड इनिशियलाइज़ करना
आप एक जेनेरेटिव मॉडल को डिप्लॉय करने के अंतिम चरण में हैं, जो एक ऑनलाइन बुकस्टोर के लिए पर्सनलाइज़्ड रिकमेंडेशन देता है। इस मॉडल को मानव-पसंदीदा रिकमेंडेशन के अनुरूप लाने के लिए, आपको कुछ इकट्ठा किए गए प्रेफरेंस डेटा से एक रिवॉर्ड मॉडल ट्रेन करना होगा। पहला कदम है मॉडल और कॉन्फ़िगरेशन पैरामीटर्स को इनिशियलाइज़ करना।
transformers से AutoTokenizer और AutoModelForSequenceClassification पहले से लोड किए गए हैं। trl से RewardConfig भी पहले से लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
- Hugging Face के
AutoModelForSequenceClassificationका उपयोग करते हुए सीक्वेंस क्लासिफिकेशन टास्क के लिए GPT-1 मॉडल"openai-gpt"लोड करें. - रिवॉर्ड कॉन्फ़िगरेशन इनिशियलाइज़ करें: आउटपुट डायरेक्टरी के रूप में
"output_dir"का उपयोग करें, और टोकन की अधिकतम लंबाई60सेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)