Identifikace nespolehlivých zdrojů dat
Tvůj tým vyvíjí model pro podporu tvorby přesných reportů v oblasti automobilové bezpečnosti. Shromáždil/a jsi preferenční data ze tří zdrojů – „GlobalDrive Safety Institute", „AutoTech Safety Alliance" a „QuickScan Auto Review". Nedávno se objevily obavy ohledně integrity dat a tvým úkolem je posoudit, zda některý ze zdrojů není nespolehlivý.
automotive_df je kombinovaný DataFrame načtený pomocí předem importované knihovny pandas. Obsahuje data ze všech tří zdrojů. Předem importovaná funkce majority_vote vytvoří slovníkový objekt s většinovým párem (chosen, rejected) pro každé 'id'.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Definuj podmínku pro zaznamenání jedné neshody s většinovým hlasováním u daného zdroje dat.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)