ПочатиПочніть безкоштовно

Підготовка набору даних уподобань

У цій вправі ви працюватимете з набором даних, що містить людський зворотний зв'язок у вигляді виходів «chosen» і «rejected». Ваше завдання — витягти підказки (prompts) зі стовпця «chosen» і підготувати дані для навчання моделі винагороди.

Функцію load_dataset з datasets уже імпортовано.

Ця вправа є частиною курсу

Reinforcement Learning from Human Feedback (RLHF)

Переглянути курс

Інструкції до вправи

  • Завантажте набір даних trl-internal-testing/hh-rlhf-helpful-base-trl-style з Hugging Face.
  • Напишіть функцію, яка витягує підказку (prompt) з поля 'content', припускаючи, що підказка міститься за індексом 0 у вхідних даних функції.
  • Застосуйте функцію для витягування підказки до підмножини набору даних 'chosen'.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Редагувати та запускати код