ÎncepețiÎncepe gratuit

Identificarea surselor de date nesigure

Echipa ta dezvoltă un model pentru a sprijini generarea de rapoarte precise în industria siguranței auto. Ai colectat date de preferință din trei surse – „GlobalDrive Safety Institute", „AutoTech Safety Alliance" și „QuickScan Auto Review". Recent, au apărut îngrijorări legate de integritatea datelor, iar ți s-a cerut să le evaluezi pentru a identifica eventuale surse nesigure.

automotive_df este un DataFrame combinat, încărcat cu ajutorul bibliotecii pandas pre-importate. Conține date din cele trei surse. Funcția pre-importată majority_vote creează un obiect de tip dicționar cu perechea majoritară (chosen, rejected) pentru fiecare 'id'.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Definește condiția pentru a contoriza un dezacord față de votul majoritar pentru o sursă de date dată.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Editează și rulează codul