負のKLダイバージェンスの緩和
RLHFの手法でモデルをファインチューニングしたところ、ベースモデルと比べて性能が悪化していることに気づきました。負のKLダイバージェンスが原因だと考えられるため、この問題を避けるために適切な生成パラメータを設定したいと考えています。
tokenizer はあらかじめインポートされています。
この演習はコースの一部です
人間のフィードバックによる強化学習(RLHF)
演習の手順
- KLダイバージェンスを避けられるように、
top_kとmin_lengthに適切な値を設定してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}