始める無料で始める

報酬モデルをチェックする

微調整に戻って確認したところ、モデルの性能は依然としてベースモデルより劣っています。今回は報酬モデルを調べることにし、分析用にモデルの出力結果をまとめたデータセットを用意しました。出力データに対して、どのようなチェックを行いますか?

データセットは reward_model_results として事前にインポートされています。

この演習はコースの一部です

人間のフィードバックによる強化学習(RLHF)

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する