LoRA で学習する
RLHF のファインチューニングを始めようとしましたが、メモリ不足エラーが続きました。8-bit 精度での読み込みに切り替えても解決しなかったため、次の一手として LoRA を適用し、より効率的にファインチューニングすることにしました。
以下はすでに読み込み済みです。
- 8-bit 精度で読み込まれたモデル
pretrained_model_8bit peftのLoraConfigとget_peft_modeltrlのAutoModelForCausalLMWithValueHead
この演習はコースの一部です
人間のフィードバックによる強化学習(RLHF)
演習の手順
- LoRA のドロップアウトを
0.1、bias の種類を lora-only に設定します。 - モデルに LoRA の設定を適用します。
- PPO 学習用に、値ヘッド付きのモデルをセットアップします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Set the configuration parameters
config = LoraConfig(
r=32,
lora_alpha=32,
lora_dropout=____,
bias=____)
# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)