Kom igångKom igång gratis

Identifiering av otillförlitliga datakällor

Ditt team utvecklar en modell för att hjälpa till att generera korrekta rapporter inom fordonssäkerhetsbranschen. Du har samlat in preferensdata från tre datakällor – "GlobalDrive Safety Institute", "AutoTech Safety Alliance" och "QuickScan Auto Review". Nyligen har det uppstått farhågor om datakvaliteten, och du har fått i uppgift att bedöma om någon datakälla är otillförlitlig.

automotive_df är en kombinerad DataFrame som laddas med det fördefinierade biblioteket pandas. Den innehåller data från de tre källorna. Den fördefinierade funktionen majority_vote skapar ett ordboksliknande objekt med majoritetspar (chosen, rejected) per 'id'.

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Definiera villkoret för att räkna en oenighet med majoritetsrösten för en given datakälla.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Redigera och kör kod