Zacznij terazZacznij za darmo

Identyfikacja niewiarygodnych źródeł danych

Twój zespół opracowuje model wspomagający generowanie dokładnych raportów w branży bezpieczeństwa motoryzacyjnego. Zebrano dane preferencji z trzech źródeł: „GlobalDrive Safety Institute", „AutoTech Safety Alliance" oraz „QuickScan Auto Review". Ostatnio pojawiły się wątpliwości co do wiarygodności tych danych i poproszono cię o ocenę, czy któreś ze źródeł jest niewiarygodne.

automotive_df to połączony DataFrame wczytany przy użyciu wstępnie zaimportowanej biblioteki pandas. Zawiera dane ze wszystkich trzech źródeł. Wstępnie zaimportowana funkcja majority_vote tworzy obiekt słownikopodobny z parą (chosen, rejected) wybraną głosowaniem większościowym dla każdego 'id'.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)

Zobacz kurs

Instrukcje do ćwiczenia

  • Zdefiniuj warunek zliczania jednej niezgodności z głosowaniem większościowym dla danego źródła danych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Edytuj i uruchom kod