微調整に戻って確認したところ、モデルの性能は依然としてベースモデルより劣っています。今回は報酬モデルを調べることにし、分析用にモデルの出力結果をまとめたデータセットを用意しました。出力データに対して、どのようなチェックを行いますか?
データセットは reward_model_results として事前にインポートされています。
reward_model_results
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、人間の入力を活用してAIモデルの学習をより効果的にする手法である人間のフィードバックによる強化学習(RLHF)の基本を紹介します。従来の強化学習との違いを理解し、人間のフィードバックがさまざまな領域でAIの性能をどのように高めるかを学んで、RLHFの第一歩を踏み出しましょう。
この章では、人間のフィードバックを収集するための仕組みの整え方を学びます。ペアワイズ比較から不確実性サンプリングまで、高品質なデータ収集のベストプラクティスを身につけ、データ収集を強化するための戦略も探ります。
この章では、人間のフィードバックによる強化学習(RLHF)トレーニングの核心に踏み込みます。PPOを用いたファインチューニングの理解、効率的に学習するテクニック、メトリクスの目標からの乖離への対処までを扱います。
この最終章では、人間のフィードバックによる強化学習(RLHF)のモデル性能を評価・改善する主要手法を学びます。ファインチューニングの指標設計から多様なフィードバック源の取り込みまで、モデルを効果的に洗練させるための総合的なツールキットを提供します。
現在の演習