Bỏ phiếu đa số trên nhiều nguồn dữ liệu
Nhóm của bạn đang phát triển một mô hình AI để tự động tạo báo cáo kiểm soát chất lượng (QC) cho smartphone. Để phục vụ mục đích này, bạn đã thu thập dữ liệu ưu tiên từ ba nguồn QC khác nhau — một "Automated Vision System", một "Human Inspector", và "Customer Feedback". Mỗi nguồn đã gán nhãn cho các cặp mẫu văn bản là 'chosen' và 'rejected'. Mỗi cặp có một 'id' duy nhất, và mỗi bản ghi thể hiện một bài đánh giá QC được ưu tiên.
quality_df là một DataFrame tổng hợp được tải bằng pandas. Nó chứa dữ liệu từ ba nguồn khác nhau. Ngoài ra, lớp Counter đã được nhập sẵn từ mô-đun collections.
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Đếm số lần xuất hiện của từng cặp (chosen, rejected) trong hàm vote.
- Tìm cặp (chosen, rejected) có số phiếu cao nhất.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
def majority_vote(df):
# Count occurrences of each (chosen, rejected) pair
votes = ____
# Find the (chosen, rejected) pair with the highest vote count
winner = ____
return winner
final_preferences = quality_df.groupby(['id']).apply(majority_vote)
print(final_preferences)