低信頼度
この演習では、報酬モデルを使って入力テキストをどれだけ自信をもって分類しているかを評価し、信頼性に欠ける予測を除外します。目的は、モデルの予測生成能力を評価し、信頼度のしきい値を適用して高信頼の予測だけを有効とすることです。
各フィードバックテキストに対する確率分布(prob_dists)とフィードバックテキスト(texts)の変数、および least_confidence() 関数は読み込まれています。
この演習はコースの一部です
人間のフィードバックによる強化学習(RLHF)
演習の手順
- 与えられたしきい値未満の信頼度となる確率分布のインデックスを抽出する関数を定義してください。
- しきい値(
0.5)は変更せず、確率分布を関数に渡してフィードバックコメントのインデックスを取得します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)