LoRA के साथ ट्रेन करें
आप RLHF फाइन-ट्यूनिंग शुरू करना चाहते थे, लेकिन बार-बार out-of-memory एरर आ रहा था. आपने मॉडल को 8-bit प्रिसिशन में लोड करने पर स्विच किया, फिर भी एरर बना रहा. इसे सुलझाने के लिए, आपने अगला कदम उठाते हुए अधिक कुशल फाइन-ट्यूनिंग के लिए LoRA लागू करने का फैसला किया.
निम्नलिखित पहले से प्री-इम्पोर्ट किए गए हैं:
- 8-bit प्रिसिशन में लोड किया गया मॉडल
pretrained_model_8bit peftसेLoraConfigऔरget_peft_modeltrlसेAutoModelForCausalLMWithValueHead
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
- LoRA ड्रॉपआउट को
0.1पर सेट करें और bias टाइप को lora-only रखें. - मॉडल में LoRA कॉन्फ़िगरेशन जोड़ें.
- PPO ट्रेनिंग के लिए वैल्यू हेड के साथ मॉडल सेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)