Identificarea surselor de date nesigure
Echipa ta dezvoltă un model pentru a sprijini generarea de rapoarte precise în industria siguranței auto. Ai colectat date de preferință din trei surse – „GlobalDrive Safety Institute", „AutoTech Safety Alliance" și „QuickScan Auto Review". Recent, au apărut îngrijorări legate de integritatea datelor, iar ți s-a cerut să le evaluezi pentru a identifica eventuale surse nesigure.
automotive_df este un DataFrame combinat, încărcat cu ajutorul bibliotecii pandas pre-importate. Conține date din cele trei surse. Funcția pre-importată majority_vote creează un obiect de tip dicționar cu perechea majoritară (chosen, rejected) pentru fiecare 'id'.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Definește condiția pentru a contoriza un dezacord față de votul majoritar pentru o sursă de date dată.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)