시작하기무료로 시작하기

선호도 데이터셋 준비하기

이 연습 문제에서는 사람이 제공한 피드백을 "chosen"과 "rejected" 출력 형태로 담고 있는 데이터셋을 다룹니다. 여러분의 과제는 "chosen" 열에서 프롬프트를 추출하고, 보상 모델 훈련을 위해 데이터를 준비하는 것입니다.

datasetsload_dataset 함수는 미리 임포트되어 있습니다.

이 연습은 강의의 일부입니다

Reinforcement Learning from Human Feedback (RLHF)

강의 보기

연습 안내

  • Hugging Face에서 trl-internal-testing/hh-rlhf-helpful-base-trl-style 데이터셋을 로드하세요.
  • 함수의 입력에서 프롬프트가 인덱스 0 위치에 있다고 가정하고, 'content' 필드에서 프롬프트를 추출하는 함수를 작성하세요.
  • 프롬프트를 추출하는 함수를 'chosen' 데이터셋 서브셋에 적용하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
코드 편집 및 실행