Подготовка набора данных с предпочтениями
В этом упражнении вы будете работать с набором данных, который содержит обратную связь от людей в виде «выбранных» и «отклонённых» ответов. Ваша задача — извлечь запросы из столбца "chosen" и подготовить данные для обучения модели вознаграждения.
Функция load_dataset из библиотеки datasets уже импортирована.
Это упражнение является частью курса
Обучение с подкреплением на основе обратной связи от людей (RLHF)
Инструкции к упражнению
- Загрузите набор данных
trl-internal-testing/hh-rlhf-helpful-base-trl-styleиз Hugging Face. - Напишите функцию, которая извлекает запрос из поля
'content', предполагая, что запрос находится по индексу0входных данных функции. - Примените функцию извлечения запроса к подмножеству
'chosen'набора данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])