Identifiering av otillförlitliga datakällor
Ditt team utvecklar en modell för att hjälpa till att generera korrekta rapporter inom fordonssäkerhetsbranschen. Du har samlat in preferensdata från tre datakällor – "GlobalDrive Safety Institute", "AutoTech Safety Alliance" och "QuickScan Auto Review". Nyligen har det uppstått farhågor om datakvaliteten, och du har fått i uppgift att bedöma om någon datakälla är otillförlitlig.
automotive_df är en kombinerad DataFrame som laddas med det fördefinierade biblioteket pandas. Den innehåller data från de tre källorna. Den fördefinierade funktionen majority_vote skapar ett ordboksliknande objekt med majoritetspar (chosen, rejected) per 'id'.
Den här övningen är en del av kursen
Reinforcement Learning from Human Feedback (RLHF)
Övningsinstruktioner
- Definiera villkoret för att räkna en oenighet med majoritetsrösten för en given datakälla.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)