Identyfikacja niewiarygodnych źródeł danych
Twój zespół opracowuje model wspomagający generowanie dokładnych raportów w branży bezpieczeństwa motoryzacyjnego. Zebrano dane preferencji z trzech źródeł: „GlobalDrive Safety Institute", „AutoTech Safety Alliance" oraz „QuickScan Auto Review". Ostatnio pojawiły się wątpliwości co do wiarygodności tych danych i poproszono cię o ocenę, czy któreś ze źródeł jest niewiarygodne.
automotive_df to połączony DataFrame wczytany przy użyciu wstępnie zaimportowanej biblioteki pandas. Zawiera dane ze wszystkich trzech źródeł. Wstępnie zaimportowana funkcja majority_vote tworzy obiekt słownikopodobny z parą (chosen, rejected) wybraną głosowaniem większościowym dla każdego 'id'.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Zdefiniuj warunek zliczania jednej niezgodności z głosowaniem większościowym dla danego źródła danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)