Repérage des sources de données peu fiables
Votre équipe met au point un modèle pour aider à produire des rapports exacts dans le secteur de la sécurité automobile. Vous avez recueilli des données de préférences provenant de trois sources : « GlobalDrive Safety Institute », « AutoTech Safety Alliance » et « QuickScan Auto Review ». Récemment, des doutes ont été soulevés quant à l'intégrité des données, et l'on vous a demandé d'évaluer s'il y a des sources peu fiables.
automotive_df est un DataFrame combiné chargé à l'aide de la bibliothèque pandas préimportée. Il contient les données des trois sources. La fonction majority_vote préimportée crée un objet de type dictionnaire avec la paire majoritaire (chosen, rejected) par 'id'.
Cette activité fait partie du cours
Reinforcement Learning from Human Feedback (RLHF)
Instructions de l’exercice
- Définissez la condition pour compter un désaccord avec le vote majoritaire pour une source de données donnée.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)