or
この演習はコースの一部です
この章では、人間の入力を活用してAIモデルの学習をより効果的にする手法である人間のフィードバックによる強化学習(RLHF)の基本を紹介します。従来の強化学習との違いを理解し、人間のフィードバックがさまざまな領域でAIの性能をどのように高めるかを学んで、RLHFの第一歩を踏み出しましょう。
この章では、人間のフィードバックを収集するための仕組みの整え方を学びます。ペアワイズ比較から不確実性サンプリングまで、高品質なデータ収集のベストプラクティスを身につけ、データ収集を強化するための戦略も探ります。
この章では、人間のフィードバックによる強化学習(RLHF)トレーニングの核心に踏み込みます。PPOを用いたファインチューニングの理解、効率的に学習するテクニック、メトリクスの目標からの乖離への対処までを扱います。
現在の演習
この最終章では、人間のフィードバックによる強化学習(RLHF)のモデル性能を評価・改善する主要手法を学びます。ファインチューニングの指標設計から多様なフィードバック源の取り込みまで、モデルを効果的に洗練させるための総合的なツールキットを提供します。