कई डेटा स्रोतों पर मेजॉरिटी वोटिंग
आपकी टीम स्मार्टफोन क्वालिटी कंट्रोल (QC) रिपोर्ट अपने आप जनरेट करने वाला एक AI मॉडल विकसित कर रही है. इस उद्देश्य से, आपने तीन अलग-अलग क्वालिटी कंट्रोल स्रोतों से प्रेफरेंस डेटा इकट्ठा किया है — एक "Automated Vision System", एक "Human Inspector", और "Customer Feedback". इन सभी ने जोड़ीदार टेक्स्ट सैंपल्स को 'chosen' और 'rejected' के रूप में लेबल किया है. हर जोड़ी का एक यूनिक 'id' है, और हर एंट्री एक पसंदीदा QC रिव्यू दिखाती है.
quality_df एक संयुक्त DataFrame है जिसे pandas से लोड किया गया है. इसमें तीनों डेटा स्रोतों का डेटा शामिल है. इसके अलावा, collections मॉड्यूल से Counter क्लास पहले से इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
- vote फंक्शन में प्रत्येक (chosen, rejected) पेयर की आवृत्ति गिनें.
- सबसे अधिक वोट काउंट वाला (chosen, rejected) पेयर खोजें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def majority_vote(df):
# Count occurrences of each (chosen, rejected) pair
votes = ____
# Find the (chosen, rejected) pair with the highest vote count
winner = ____
return winner
final_preferences = quality_df.groupby(['id']).apply(majority_vote)
print(final_preferences)