始める無料で始める

RLHF を使ったテキスト生成

この演習では、RLHF で事前学習されたモデル lvwerra/gpt2-imdb-pos-v2 を使います。Hugging Face のパイプラインを組み立てる手順を復習し、RLHF 学習済みモデルのユースケースである映画レビューの生成を試します。

pipeline, AutoModelForCausalLM, and AutoTokenizer オブジェクトは transformers から事前にインポート済みです。tokenizer もすでに読み込まれています。

この演習はコースの一部です

人間のフィードバックによる強化学習(RLHF)

コースを見る

演習の手順

  • モデル名に、RLHF で事前学習された lvwerra/gpt2-imdb-pos-v2 を指定します。
  • pipeline 関数を使って text-generation パイプラインを作成します。
  • 作成したテキスト生成パイプラインで、与えられたレビュー文の続きを生成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)

# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)

review_prompt = "Surprisingly, the film"

# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")
コードを編集して実行