开始使用免费开始使用

基于多个数据源的多数投票

您的团队正在开发一个 AI 模型,用于自动生成智能手机质量控制(QC)报告。为此,您从三个不同的质检来源收集了偏好数据——"Automated Vision System"(自动化视觉系统)、"Human Inspector"(人工检验)以及 "Customer Feedback"(客户反馈)。他们各自对成对的文本样本进行了标注,标为"chosen"(更优)与"rejected"(较差)。每个样本对都有唯一的 id,每条记录都展示了一个首选的 QC 评审结果。

quality_df 是使用 pandas 加载的合并 DataFrame,包含来自三个不同数据源的数据。此外,已从 collections 模块预先导入了 Counter 类。

本练习是课程的一部分

来自人类反馈的强化学习(RLHF)

查看课程

练习说明

  • 在投票函数中统计每个(chosen, rejected)对的出现次数。
  • 找到票数最高的(chosen, rejected)对。

交互式实操练习

通过完成这段示例代码来试试这个练习。

def majority_vote(df):
  	# Count occurrences of each (chosen, rejected) pair
    votes = ____
    # Find the (chosen, rejected) pair with the highest vote count
    winner = ____
    return winner

final_preferences = quality_df.groupby(['id']).apply(majority_vote)

print(final_preferences)
编辑并运行代码