RLHF로 텍스트 생성
이 연습 문제에서는 RLHF로 사전 학습된 lvwerra/gpt2-imdb-pos-v2 모델을 사용해 보겠습니다. 이 문제를 통해 Hugging Face 파이프라인을 구성하는 방법을 복습하고, RLHF로 학습한 모델의 활용 사례인 영화 리뷰 생성 작업을 시험해 볼 거예요.
pipeline, AutoModelForCausalLM, and AutoTokenizer 객체는 이미 transformers에서 임포트되어 있습니다. 또한 tokenizer도 미리 로드되어 있어요
이 연습은 강의의 일부입니다
Reinforcement Learning from Human Feedback (RLHF)
연습 안내
- 모델 이름을 RLHF로 사전 학습된
lvwerra/gpt2-imdb-pos-v2로 설정하세요. pipeline함수를 사용해text-generation파이프라인을 만드세요.- 생성 파이프라인을 사용하여 제공된 리뷰의 이어지는 내용을 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")