开始使用免费开始使用

使用 RLHF 的文本生成

在本练习中,您将使用一个经过 RLHF 预训练的模型 lvwerra/gpt2-imdb-pos-v2。本练习将复习如何构建 Hugging Face 的 pipeline,并用它来测试 RLHF 训练模型的一个用例:生成电影评论。

已从 transformers 预先导入 pipeline, AutoModelForCausalLM, and AutoTokenizer 对象。tokenizer 也已预加载。

本练习是课程的一部分

来自人类反馈的强化学习(RLHF)

查看课程

练习说明

  • 将模型名称设为 lvwerra/gpt2-imdb-pos-v2,即该 RLHF 预训练模型。
  • 使用 pipeline 函数创建一个 text-generation 管道。
  • 使用该文本生成管道,为给定的评论生成后续内容。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)

# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)

review_prompt = "Surprisingly, the film"

# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")
编辑并运行代码