Sinh văn bản với RLHF
Trong bài tập này, bạn sẽ làm việc với một mô hình được huấn luyện sẵn bằng RLHF có tên lvwerra/gpt2-imdb-pos-v2. Đây là cơ hội để bạn ôn lại cách xây dựng một pipeline của Hugging Face và dùng nó để kiểm thử một trường hợp sử dụng của các mô hình được huấn luyện bằng RLHF: sinh bài đánh giá phim.
Các đối tượng pipeline, AutoModelForCausalLM, and AutoTokenizer đã được nhập sẵn từ transformers. tokenizer cũng đã được nạp sẵn
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Đặt tên mô hình là
lvwerra/gpt2-imdb-pos-v2, mô hình được huấn luyện trước bằng RLHF. - Dùng hàm
pipelineđể tạo một pipelinetext-generation. - Dùng pipeline sinh văn bản để tạo phần tiếp nối cho bài đánh giá đã cho.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")