НачатьНачать бесплатно

Проверка модели вознаграждения

Вы возвращаетесь к дообучению модели и замечаете, что её производительность по-прежнему уступает базовой модели. На этот раз вы хотите проверить модель вознаграждения: вы подготовили набор данных с результатами её работы и собираетесь проанализировать их. Какие проверки выходных данных вы выполните?

Набор данных предварительно импортирован как reward_model_results.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение