Выявление ненадёжных источников данных
Ваша команда разрабатывает модель для формирования точной отчётности в области автомобильной безопасности. Вы собрали данные о предпочтениях из трёх источников: «GlobalDrive Safety Institute», «AutoTech Safety Alliance» и «QuickScan Auto Review». В последнее время появились сомнения в достоверности данных, и вам поручено оценить их на предмет ненадёжных источников.
automotive_df — это объединённый DataFrame, загруженный с помощью предварительно импортированной библиотеки pandas. Он содержит данные из всех трёх источников. Предварительно импортированная функция majority_vote создаёт объект в виде словаря с парой «выбрано/отклонено» по большинству голосов для каждого 'id'.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Определите условие для подсчёта одного расхождения с результатом голосования большинства для заданного источника данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
def detect_unreliable_source(merged_df):
df_majority = df.groupby('id').apply(majority_vote)
disagreements = {source: 0 for source in df['source'].unique()}
for _, row in df.iterrows():
# Condition to find a disagreement with majority vote
____
unreliable_source = max(disagreements, key=disagreements.get)
return unreliable_source
disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)