शुरू करेंमुफ़्त में शुरू करें

LoRA के साथ ट्रेन करें

आप RLHF फाइन-ट्यूनिंग शुरू करना चाहते थे, लेकिन बार-बार out-of-memory एरर आ रहा था. आपने मॉडल को 8-bit प्रिसिशन में लोड करने पर स्विच किया, फिर भी एरर बना रहा. इसे सुलझाने के लिए, आपने अगला कदम उठाते हुए अधिक कुशल फाइन-ट्यूनिंग के लिए LoRA लागू करने का फैसला किया.

निम्नलिखित पहले से प्री-इम्पोर्ट किए गए हैं:

  • 8-bit प्रिसिशन में लोड किया गया मॉडल pretrained_model_8bit
  • peft से LoraConfig और get_peft_model
  • trl से AutoModelForCausalLMWithValueHead

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • LoRA ड्रॉपआउट को 0.1 पर सेट करें और bias टाइप को lora-only रखें.
  • मॉडल में LoRA कॉन्फ़िगरेशन जोड़ें.
  • PPO ट्रेनिंग के लिए वैल्यू हेड के साथ मॉडल सेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
कोड संपादित करें और चलाएँ