始める無料で始める

LoRA で学習する

RLHF のファインチューニングを始めようとしましたが、メモリ不足エラーが続きました。8-bit 精度での読み込みに切り替えても解決しなかったため、次の一手として LoRA を適用し、より効率的にファインチューニングすることにしました。

以下はすでに読み込み済みです。

  • 8-bit 精度で読み込まれたモデル pretrained_model_8bit
  • peftLoraConfigget_peft_model
  • trlAutoModelForCausalLMWithValueHead

この演習はコースの一部です

人間のフィードバックによる強化学習(RLHF)

コースを見る

演習の手順

  • LoRA のドロップアウトを 0.1、bias の種類を lora-only に設定します。
  • モデルに LoRA の設定を適用します。
  • PPO 学習用に、値ヘッド付きのモデルをセットアップします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Set the configuration parameters
config = LoraConfig(
    r=32,  
    lora_alpha=32,  
    lora_dropout=____,  
    bias=____)  

# Apply the LoRA configuration to the 8-bit model
lora_model = get_peft_model(pretrained_model_8bit, ____)
# Set up the tokenizer and model with a value head for PPO training
model = ____.from_pretrained(____)
コードを編集して実行