Khởi tạo reward
Bạn đang ở giai đoạn cuối cùng để triển khai một mô hình sinh (generative model) dùng cho gợi ý cá nhân hóa của một hiệu sách trực tuyến. Để mô hình phù hợp với các gợi ý được con người ưa thích, bạn cần huấn luyện một reward model bằng dữ liệu sở thích đã thu thập. Bước đầu tiên là khởi tạo mô hình và các tham số cấu hình.
AutoTokenizer và AutoModelForSequenceClassification đã được nạp sẵn từ transformers. RewardConfig đã được nạp sẵn từ trl.
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Tải mô hình GPT-1,
"openai-gpt", cho tác vụ phân loại chuỗi bằngAutoModelForSequenceClassificationcủa Hugging Face. - Khởi tạo cấu hình reward, dùng
"output_dir"làm thư mục đầu ra và đặt độ dài tối đa của token là60.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the pre-trained GPT-1 model for text classification
model = ____
tokenizer = AutoTokenizer.from_pretrained("openai-gpt")
# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)