शुरू करेंमुफ़्त में शुरू करें

PPO ट्रेनर इनिशियलाइज़ करें

आप एक कस्टमर सर्विस कंपनी में काम करते हैं जो कस्टमर की क्वेरी सँभालने के लिए एक चैटबॉट का उपयोग करती है। चैटबॉट उपयोगी जवाब देता है, लेकिन हाल ही में फीडबैक मिला है कि उनमें गहराई की कमी है। आपको चैटबॉट के पीछे के मॉडल को फाइन-ट्यून करना है, और आप एक PPO ट्रेनर इंस्टेंस बनाकर शुरुआत करते हैं.

dataset_cs पहले से लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • मॉडल नाम "gpt2" और learning rate 1.2e-5 के साथ PPO कॉन्फ़िगरेशन इनिशियलाइज़ करें.
  • AutoModelForCausalLMWithValueHead, यानी value head वाला causal language model, लोड करें.
  • अभी परिभाषित किए गए model, configuration, और tokenizer के साथ, और preloaded dataset का उपयोग करते हुए PPOTrainer() बनाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer

# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)

# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)

# Initialize PPO Trainer
ppo_trainer = ____
कोड संपादित करें और चलाएँ