Обучение с LoRA
Вы приступили к дообучению методом RLHF, однако постоянно сталкивались с ошибками нехватки памяти. Даже после перехода на загрузку модели в 8-битной точности ошибка не исчезла. Чтобы решить эту проблему, вы решили сделать следующий шаг и применить LoRA для более эффективного дообучения.
Следующие объекты уже импортированы:
- Модель, загруженная в 8-битной точности, как
pretrained_model_8bit LoraConfigиget_peft_modelизpeftAutoModelForCausalLMWithValueHeadизtrl
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Задайте значение dropout для LoRA равным
0.1, а тип смещения — только для LoRA. - Добавьте конфигурацию LoRA к модели.
- Настройте модель с головой значений для обучения с PPO.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)