Проверка модели вознаграждения
Вы возвращаетесь к дообучению модели и замечаете, что её производительность по-прежнему уступает базовой модели. На этот раз вы хотите проверить модель вознаграждения: вы подготовили набор данных с результатами её работы и собираетесь проанализировать их. Какие проверки выходных данных вы выполните?
Набор данных предварительно импортирован как reward_model_results.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение