Виявлення ненадійного джерела даних
Ваша команда розробляє модель для допомоги у створенні точних звітів у сфері автомобільної безпеки. Ви зібрали дані про вподобання з трьох джерел даних — «GlobalDrive Safety Institute», «AutoTech Safety Alliance» та «QuickScan Auto Review». Нещодавно з'явилися застереження щодо цілісності даних, і вас попросили оцінити їх на наявність ненадійних джерел даних.
automotive_df — це об'єднаний DataFrame, завантажений за допомогою попередньо імпортованої бібліотеки pandas. Він містить дані з трьох джерел. Попередньо імпортована функція majority_vote створює об'єкт на кшталт словника з парою більшості (chosen, rejected) для кожного 'id'.
Ця вправа є частиною курсу
Reinforcement Learning from Human Feedback (RLHF)
Інструкції до вправи
- Визначте умову для підрахунку однієї розбіжності з результатом голосування більшості для заданого джерела даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)