Генерация текста с помощью RLHF
В этом упражнении вы будете работать с моделью, предварительно обученной с применением RLHF, которая называется lvwerra/gpt2-imdb-pos-v2. Упражнение позволит вам вспомнить, как создаётся пайплайн Hugging Face, и проверить один из сценариев использования моделей, обученных с RLHF: генерацию рецензий на фильмы.
Объекты pipeline, AutoModelForCausalLM и AutoTokenizer уже импортированы из transformers. Токенизатор (tokenizer) также предварительно загружен.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Задайте имя модели
lvwerra/gpt2-imdb-pos-v2— это модель, предобученная с использованием RLHF. - С помощью функции
pipelineсоздайте пайплайн для генерации текста (text-generation). - Используйте этот пайплайн, чтобы сгенерировать продолжение предложенной рецензии.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")