开始使用免费开始使用

低置信度

在本练习中,您将使用一个奖励模型来评估其对输入文本的分类置信度,并过滤掉缺乏可靠性的预测。目标是评估模型生成预测的能力,并应用置信度阈值,确保只有高置信度的预测被视为有效。

每条反馈文本对应的概率分布变量(prob_dists)与反馈文本(texts)以及 least_confidence() 函数均已加载。

本练习是课程的一部分

来自人类反馈的强化学习(RLHF)

查看课程

练习说明

  • 定义一个函数,用于过滤置信度低于给定阈值的概率分布的索引。
  • 将概率分布传入该函数,保持阈值不变(0.5),以获取反馈评论的索引。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
    filtered_indices = [i for i, ____ in enumerate(____) ____]
    return filtered_indices

# Find the indices
filtered_indices = ____

high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)
编辑并运行代码