始める無料で始める

負のKLダイバージェンスの緩和

RLHFの手法でモデルをファインチューニングしたところ、ベースモデルと比べて性能が悪化していることに気づきました。負のKLダイバージェンスが原因だと考えられるため、この問題を避けるために適切な生成パラメータを設定したいと考えています。

tokenizer はあらかじめインポートされています。

この演習はコースの一部です

人間のフィードバックによる強化学習(RLHF)

コースを見る

演習の手順

  • KLダイバージェンスを避けられるように、top_kmin_length に適切な値を設定してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
コードを編集して実行