ПочатиПочніть безкоштовно

Виявлення ненадійного джерела даних

Ваша команда розробляє модель для допомоги у створенні точних звітів у сфері автомобільної безпеки. Ви зібрали дані про вподобання з трьох джерел даних — «GlobalDrive Safety Institute», «AutoTech Safety Alliance» та «QuickScan Auto Review». Нещодавно з'явилися застереження щодо цілісності даних, і вас попросили оцінити їх на наявність ненадійних джерел даних.

automotive_df — це об'єднаний DataFrame, завантажений за допомогою попередньо імпортованої бібліотеки pandas. Він містить дані з трьох джерел. Попередньо імпортована функція majority_vote створює об'єкт на кшталт словника з парою більшості (chosen, rejected) для кожного 'id'.

Ця вправа є частиною курсу

Reinforcement Learning from Human Feedback (RLHF)

Переглянути курс

Інструкції до вправи

  • Визначте умову для підрахунку однієї розбіжності з результатом голосування більшості для заданого джерела даних.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Редагувати та запускати код