RLHF を使ったテキスト生成
この演習では、RLHF で事前学習されたモデル lvwerra/gpt2-imdb-pos-v2 を使います。Hugging Face のパイプラインを組み立てる手順を復習し、RLHF 学習済みモデルのユースケースである映画レビューの生成を試します。
pipeline, AutoModelForCausalLM, and AutoTokenizer オブジェクトは transformers から事前にインポート済みです。tokenizer もすでに読み込まれています。
この演習はコースの一部です
人間のフィードバックによる強化学習(RLHF)
演習の手順
- モデル名に、RLHF で事前学習された
lvwerra/gpt2-imdb-pos-v2を指定します。 pipeline関数を使ってtext-generationパイプラインを作成します。- 作成したテキスト生成パイプラインで、与えられたレビュー文の続きを生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")