Začněte nyníZačněte zdarma

Identifikace nespolehlivých zdrojů dat

Tvůj tým vyvíjí model pro podporu tvorby přesných reportů v oblasti automobilové bezpečnosti. Shromáždil/a jsi preferenční data ze tří zdrojů – „GlobalDrive Safety Institute", „AutoTech Safety Alliance" a „QuickScan Auto Review". Nedávno se objevily obavy ohledně integrity dat a tvým úkolem je posoudit, zda některý ze zdrojů není nespolehlivý.

automotive_df je kombinovaný DataFrame načtený pomocí předem importované knihovny pandas. Obsahuje data ze všech tří zdrojů. Předem importovaná funkce majority_vote vytvoří slovníkový objekt s většinovým párem (chosen, rejected) pro každé 'id'.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Definuj podmínku pro zaznamenání jedné neshody s většinovým hlasováním u daného zdroje dat.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Upravit a spustit kód