Bắt đầu ngayBắt đầu miễn phí

Khởi tạo reward

Bạn đang ở giai đoạn cuối cùng để triển khai một mô hình sinh (generative model) dùng cho gợi ý cá nhân hóa của một hiệu sách trực tuyến. Để mô hình phù hợp với các gợi ý được con người ưa thích, bạn cần huấn luyện một reward model bằng dữ liệu sở thích đã thu thập. Bước đầu tiên là khởi tạo mô hình và các tham số cấu hình.

AutoTokenizerAutoModelForSequenceClassification đã được nạp sẵn từ transformers. RewardConfig đã được nạp sẵn từ trl.

Bài tập này là một phần của khóa học

Reinforcement Learning from Human Feedback (RLHF)

Xem khóa học

Hướng dẫn bài tập

  • Tải mô hình GPT-1, "openai-gpt", cho tác vụ phân loại chuỗi bằng AutoModelForSequenceClassification của Hugging Face.
  • Khởi tạo cấu hình reward, dùng "output_dir" làm thư mục đầu ra và đặt độ dài tối đa của token là 60.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the pre-trained GPT-1 model for text classification
model = ____

tokenizer = AutoTokenizer.from_pretrained("openai-gpt")

# Initialize the reward configuration and set max_length
config = ____(output_dir=____, max_length=____)
Chỉnh sửa và Chạy Mã