การโหวตแบบเสียงข้างมากจากแหล่งข้อมูลหลายแหล่ง
ทีมของคุณกำลังพัฒนาโมเดล AI เพื่อสร้างรายงานการควบคุมคุณภาพ (QC) สำหรับสมาร์ทโฟนโดยอัตโนมัติ เพื่อจุดประสงค์นี้ จึงได้รวบรวมข้อมูลความชอบจากแหล่งควบคุมคุณภาพสามแหล่ง ได้แก่ "ระบบตรวจสอบภาพอัตโนมัติ (Automated Vision System)" "ผู้ตรวจสอบคน (Human Inspector)" และ "ความคิดเห็นลูกค้า (Customer Feedback)" แต่ละแหล่งได้ติดป้ายกำกับตัวอย่างข้อความเป็นคู่ว่า 'chosen' และ 'rejected' โดยแต่ละคู่มี 'id' เฉพาะและแสดงรีวิว QC ที่ได้รับการเลือก
quality_df คือ DataFrame รวมที่โหลดด้วย pandas ซึ่งประกอบด้วยข้อมูลจากแหล่งข้อมูลทั้งสามแหล่ง นอกจากนี้ยังได้นำเข้าคลาส Counter จากโมดูล collections ไว้ล่วงหน้าแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- นับจำนวนครั้งที่แต่ละคู่ (chosen, rejected) ปรากฏในฟังก์ชัน vote
- หาคู่ (chosen, rejected) ที่ได้รับคะแนนโหวตสูงสุด
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def majority_vote(df):
# Count occurrences of each (chosen, rejected) pair
votes = ____
# Find the (chosen, rejected) pair with the highest vote count
winner = ____
return winner
final_preferences = quality_df.groupby(['id']).apply(majority_vote)
print(final_preferences)