시작하기무료로 시작하기

RLHF로 텍스트 생성

이 연습 문제에서는 RLHF로 사전 학습된 lvwerra/gpt2-imdb-pos-v2 모델을 사용해 보겠습니다. 이 문제를 통해 Hugging Face 파이프라인을 구성하는 방법을 복습하고, RLHF로 학습한 모델의 활용 사례인 영화 리뷰 생성 작업을 시험해 볼 거예요.

pipeline, AutoModelForCausalLM, and AutoTokenizer 객체는 이미 transformers에서 임포트되어 있습니다. 또한 tokenizer도 미리 로드되어 있어요

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

연습 안내

  • 모델 이름을 RLHF로 사전 학습된 lvwerra/gpt2-imdb-pos-v2로 설정하세요.
  • pipeline 함수를 사용해 text-generation 파이프라인을 만드세요.
  • 생성 파이프라인을 사용하여 제공된 리뷰의 이어지는 내용을 생성하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)

# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)

review_prompt = "Surprisingly, the film"

# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")
코드 편집 및 실행