НачатьНачать бесплатно

Подготовка набора данных с предпочтениями

В этом упражнении вы будете работать с набором данных, который содержит обратную связь от людей в виде «выбранных» и «отклонённых» ответов. Ваша задача — извлечь запросы из столбца "chosen" и подготовить данные для обучения модели вознаграждения.

Функция load_dataset из библиотеки datasets уже импортирована.

Это упражнение является частью курса

Обучение с подкреплением на основе обратной связи от людей (RLHF)

Посмотреть курс

Инструкции к упражнению

  • Загрузите набор данных trl-internal-testing/hh-rlhf-helpful-base-trl-style из Hugging Face.
  • Напишите функцию, которая извлекает запрос из поля 'content', предполагая, что запрос находится по индексу 0 входных данных функции.
  • Примените функцию извлечения запроса к подмножеству 'chosen' набора данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Редактировать и запускать код