НачатьНачать бесплатно

Выявление ненадёжных источников данных

Ваша команда разрабатывает модель для формирования точной отчётности в области автомобильной безопасности. Вы собрали данные о предпочтениях из трёх источников: «GlobalDrive Safety Institute», «AutoTech Safety Alliance» и «QuickScan Auto Review». В последнее время появились сомнения в достоверности данных, и вам поручено оценить их на предмет ненадёжных источников.

automotive_df — это объединённый DataFrame, загруженный с помощью предварительно импортированной библиотеки pandas. Он содержит данные из всех трёх источников. Предварительно импортированная функция majority_vote создаёт объект в виде словаря с парой «выбрано/отклонено» по большинству голосов для каждого 'id'.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Определите условие для подсчёта одного расхождения с результатом голосования большинства для заданного источника данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Редактировать и запускать код