1. Learn
  2. /
  3. Курси
  4. /
  5. Reinforcement Learning from Human Feedback (RLHF)

Connected

Вправа

Підготовка до навчання у 8 бітах

Ви хотіли розпочати тонке налаштування RLHF, але постійно стикалися з помилками нестачі пам'яті. Щоб розв'язати цю проблему, ви вирішили перейти на 8-бітну точність, яка дає змогу ефективніше виконувати тонке налаштування, скориставшись бібліотекою Hugging Face peft.

Попередньо імпортовано таке:

  • AutoModelForCausalLM з transformers
  • prepare_model_for_int8_training з peft
  • AutoModelForCausalLMWithValueHead з trl

Інструкції

100 XP
  • Завантажте попередньо натреновану модель і не забудьте додати параметр для 8-бітної точності.
  • Скористайтеся функцією prepare_model_for_int8_training, щоб підготувати модель до тонкого налаштування на основі LoRA.
  • Завантажте модель із «value head» для навчання PPO.