अविश्वसनीय डेटा स्रोत की पहचान
आपकी टीम ऑटोमोटिव सेफ्टी उद्योग में सटीक रिपोर्टिंग बनाने में सहायता करने वाला एक मॉडल विकसित कर रही है। आपने तीन डेटा स्रोतों से प्रेफ़रेंस डेटा इकट्ठा किया है — "GlobalDrive Safety Institute", "AutoTech Safety Alliance", और "QuickScan Auto Review"। हाल ही में डेटा की विश्वसनीयता को लेकर चिंताएँ उठी हैं, और आपसे कहा गया है कि आप किसी भी अविश्वसनीय डेटा स्रोत का आकलन करें।
automotive_df एक संयुक्त DataFrame है जो पहले से इम्पोर्ट की गई pandas लाइब्रेरी से लोड किया गया है। इसमें इन तीनों स्रोतों का डेटा है। पहले से इम्पोर्ट किया गया majority_vote फंक्शन प्रत्येक 'id' के लिए बहुमत (chosen, rejected) पेयर के साथ एक dictionary-जैसा ऑब्जेक्ट बनाता है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
- किसी दिए गए डेटा स्रोत के लिए बहुमत वोट से एक असहमति गिनने की शर्त परिभाषित करें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)