НачатьНачать бесплатно

Низкая уверенность

В этом упражнении вы будете работать с моделью вознаграждения: оценивать, насколько уверенно она классифицирует входной текст, и отфильтровывать ненадёжные предсказания. Цель — проверить способность модели формировать предсказания и применить пороговое значение уверенности, чтобы учитывались только надёжные результаты.

Переменные с распределениями вероятностей для каждого текста обратной связи (prob_dists) и с самими текстами (texts), а также функция least_confidence() уже загружены.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Определите функцию, которая фильтрует индексы распределений вероятностей, для которых уверенность ниже заданного порогового значения.
  • Получите индексы комментариев обратной связи, передав распределения вероятностей в функцию и оставив пороговое значение без изменений (0.5).

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
    filtered_indices = [i for i, ____ in enumerate(____) ____]
    return filtered_indices

# Find the indices
filtered_indices = ____

high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)
Редактировать и запускать код