Низкая уверенность
В этом упражнении вы будете работать с моделью вознаграждения: оценивать, насколько уверенно она классифицирует входной текст, и отфильтровывать ненадёжные предсказания. Цель — проверить способность модели формировать предсказания и применить пороговое значение уверенности, чтобы учитывались только надёжные результаты.
Переменные с распределениями вероятностей для каждого текста обратной связи (prob_dists) и с самими текстами (texts), а также функция least_confidence() уже загружены.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Определите функцию, которая фильтрует индексы распределений вероятностей, для которых уверенность ниже заданного порогового значения.
- Получите индексы комментариев обратной связи, передав распределения вероятностей в функцию и оставив пороговое значение без изменений (
0.5).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Define the filter function
def filter_low_confidence_predictions(prob_dists, threshold=0.5):
filtered_indices = [i for i, ____ in enumerate(____) ____]
return filtered_indices
# Find the indices
filtered_indices = ____
high_confidence_texts = [texts[i] for i in filtered_indices]
print("High-confidence texts:", high_confidence_texts)