НачатьНачать бесплатно

Обучение с LoRA

Вы приступили к дообучению методом RLHF, однако постоянно сталкивались с ошибками нехватки памяти. Даже после перехода на загрузку модели в 8-битной точности ошибка не исчезла. Чтобы решить эту проблему, вы решили сделать следующий шаг и применить LoRA для более эффективного дообучения.

Следующие объекты уже импортированы:

  • Модель, загруженная в 8-битной точности, как pretrained_model_8bit
  • LoraConfig и get_peft_model из peft
  • AutoModelForCausalLMWithValueHead из trl

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Задайте значение dropout для LoRA равным 0.1, а тип смещения — только для LoRA.
  • Добавьте конфигурацию LoRA к модели.
  • Настройте модель с головой значений для обучения с PPO.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
Редактировать и запускать код