Bắt đầu ngayBắt đầu miễn phí

Chuẩn bị tập dữ liệu ưu tiên

Trong bài tập này, bạn sẽ làm việc với một tập dữ liệu chứa phản hồi của con người dưới dạng đầu ra "được chọn" và "bị từ chối". Nhiệm vụ của bạn là trích xuất các prompt từ cột "được chọn" và chuẩn bị dữ liệu để huấn luyện một mô hình phần thưởng.

Hàm load_dataset từ datasets đã được nhập sẵn

Bài tập này là một phần của khóa học

Reinforcement Learning from Human Feedback (RLHF)

Xem khóa học

Hướng dẫn bài tập

  • Tải tập dữ liệu trl-internal-testing/hh-rlhf-helpful-base-trl-style từ Hugging Face.
  • Viết một hàm trích xuất prompt từ trường 'content', giả định rằng prompt nằm ở chỉ mục 0 của đầu vào cho hàm.
  • Áp dụng hàm trích xuất prompt cho phân tập dữ liệu 'chosen'.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Chỉnh sửa và Chạy Mã