Инициализация вознаграждения
Вы находитесь на финальном этапе развёртывания генеративной модели, предназначенной для персонализированных рекомендаций в онлайн-книжном магазине. Чтобы привести эту модель в соответствие с предпочтениями пользователей, необходимо обучить модель вознаграждения на собранных данных о предпочтениях. Первый шаг — инициализация модели и параметров конфигурации.
AutoTokenizer и AutoModelForSequenceClassification были предварительно загружены из transformers. RewardConfig был предварительно загружен из trl.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Загрузите модель GPT-1,
"openai-gpt", для задачи классификации последовательностей с помощьюAutoModelForSequenceClassificationиз Hugging Face. - Инициализируйте конфигурацию вознаграждения, указав
"output_dir"в качестве директории вывода и установив максимальную длину токена равной60.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)