НачатьНачать бесплатно

Метод большинства голосов для нескольких источников данных

Ваша команда разрабатывает модель ИИ для автоматического создания отчётов о контроле качества (КК) смартфонов. Для этого вы собрали данные о предпочтениях из трёх различных источников: «Автоматизированная система визуального контроля», «Инспектор-человек» и «Обратная связь от клиентов». Каждый источник разметил пары текстовых образцов как «выбранный» и «отклонённый». Каждая пара имеет уникальный идентификатор id, а каждая запись представляет предпочтительный отзыв по КК.

quality_df — это объединённый DataFrame, загруженный с помощью pandas. Он содержит данные из трёх различных источников. Кроме того, класс Counter уже импортирован из модуля collections.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Подсчитайте количество вхождений каждой пары (chosen, rejected) в функции vote.
  • Найдите пару (chosen, rejected) с наибольшим количеством голосов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

def majority_vote(df):
  	# Count occurrences of each (chosen, rejected) pair
    votes = ____
    # Find the (chosen, rejected) pair with the highest vote count
    winner = ____
    return winner

final_preferences = quality_df.groupby(['id']).apply(majority_vote)

print(final_preferences)
Редактировать и запускать код