Khởi tạo PPO trainer
Bạn đang làm việc cho một công ty dịch vụ khách hàng sử dụng chatbot để xử lý yêu cầu. Chatbot đưa ra phản hồi hữu ích, nhưng gần đây bạn nhận được phản hồi rằng câu trả lời còn thiếu chiều sâu. Bạn cần fine-tune mô hình đứng sau chatbot và bắt đầu bằng cách tạo một instance PPO trainer.
dataset_cs đã được tải sẵn.
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Khởi tạo cấu hình PPO với tên mô hình
"gpt2"và tốc độ học1.2e-5. - Tải
AutoModelForCausalLMWithValueHead, mô hình ngôn ngữ nhân quả có value head. - Tạo
PPOTrainer()bằng model, cấu hình và tokenizer vừa định nghĩa, cùng với dataset đã tải sẵn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from trl import PPOConfig, AutoModelForCausalLMWithValueHead, PPOTrainer
from transformers import AutoTokenizer
# Initialize PPO Configuration
gpt2_config = ____(model_name=____, learning_rate=____)
# Load the model
gpt2_model = ____(gpt2_config.model_name)
gpt2_tokenizer = AutoTokenizer.from_pretrained(gpt2_config.model_name)
# Initialize PPO Trainer
ppo_trainer = ____