低置信度
在本练习中,您将使用一个奖励模型来评估其对输入文本的分类置信度,并过滤掉缺乏可靠性的预测。目标是评估模型生成预测的能力,并应用置信度阈值,确保只有高置信度的预测被视为有效。
每条反馈文本对应的概率分布变量(prob_dists)与反馈文本(texts)以及 least_confidence() 函数均已加载。
本练习是课程的一部分
来自人类反馈的强化学习(RLHF)
练习说明
- 定义一个函数,用于过滤置信度低于给定阈值的概率分布的索引。
- 将概率分布传入该函数,保持阈值不变(
0.5),以获取反馈评论的索引。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)