Chuẩn bị tập dữ liệu ưu tiên
Trong bài tập này, bạn sẽ làm việc với một tập dữ liệu chứa phản hồi của con người dưới dạng đầu ra "được chọn" và "bị từ chối". Nhiệm vụ của bạn là trích xuất các prompt từ cột "được chọn" và chuẩn bị dữ liệu để huấn luyện một mô hình phần thưởng.
Hàm load_dataset từ datasets đã được nhập sẵn
Bài tập này là một phần của khóa học
Reinforcement Learning from Human Feedback (RLHF)
Hướng dẫn bài tập
- Tải tập dữ liệu
trl-internal-testing/hh-rlhf-helpful-base-trl-styletừ Hugging Face. - Viết một hàm trích xuất prompt từ trường
'content', giả định rằng prompt nằm ở chỉ mục0của đầu vào cho hàm. - Áp dụng hàm trích xuất prompt cho phân tập dữ liệu
'chosen'.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])