선호도 데이터셋 준비하기
이 연습 문제에서는 사람이 제공한 피드백을 "chosen"과 "rejected" 출력 형태로 담고 있는 데이터셋을 다룹니다. 여러분의 과제는 "chosen" 열에서 프롬프트를 추출하고, 보상 모델 훈련을 위해 데이터를 준비하는 것입니다.
datasets의 load_dataset 함수는 미리 임포트되어 있습니다.
이 연습은 강의의 일부입니다
Reinforcement Learning from Human Feedback (RLHF)
연습 안내
- Hugging Face에서
trl-internal-testing/hh-rlhf-helpful-base-trl-style데이터셋을 로드하세요. - 함수의 입력에서 프롬프트가 인덱스
0위치에 있다고 가정하고,'content'필드에서 프롬프트를 추출하는 함수를 작성하세요. - 프롬프트를 추출하는 함수를
'chosen'데이터셋 서브셋에 적용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])