การระบุแหล่งข้อมูลที่ไม่น่าเชื่อถือ
ทีมของคุณกำลังพัฒนาโมเดลสำหรับช่วยสร้างรายงานที่แม่นยำในอุตสาหกรรมความปลอดภัยยานยนต์ โดยได้รวบรวมข้อมูล preference จากแหล่งข้อมูลสามแห่ง ได้แก่ "GlobalDrive Safety Institute", "AutoTech Safety Alliance" และ "QuickScan Auto Review" เมื่อเร็ว ๆ นี้ เกิดข้อกังวลเกี่ยวกับความถูกต้องของข้อมูล จึงได้รับมอบหมายให้ตรวจสอบว่ามีแหล่งข้อมูลใดที่ไม่น่าเชื่อถือหรือไม่
automotive_df คือ DataFrame รวมที่โหลดโดยใช้ไลบรารี pandas ที่ import ไว้แล้ว ซึ่งประกอบด้วยข้อมูลจากทั้งสามแหล่ง ฟังก์ชัน majority_vote ที่ import ไว้แล้วจะสร้างออบเจกต์คล้าย dictionary ที่เก็บคู่ (chosen, rejected) ซึ่งได้รับเสียงส่วนใหญ่ในแต่ละ 'id'
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning from Human Feedback (RLHF)
คำแนะนำการฝึกหัด
- กำหนดเงื่อนไขสำหรับนับหนึ่งความไม่สอดคล้องกับการโหวตเสียงส่วนใหญ่ของแหล่งข้อมูลที่กำหนด
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)