Przygotowanie zbioru danych preferencji
W tym ćwiczeniu będziesz pracować ze zbiorem danych zawierającym informacje zwrotne od ludzi w postaci wyników oznaczonych jako "chosen" (wybrany) i "rejected" (odrzucony). Twoim zadaniem jest wyodrębnienie promptów z kolumny "chosen" i przygotowanie danych do trenowania modelu nagrody.
Funkcja load_dataset z biblioteki datasets została już zaimportowana.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z informacją zwrotną od człowieka (RLHF)
Instrukcje do ćwiczenia
- Wczytaj zbiór danych
trl-internal-testing/hh-rlhf-helpful-base-trl-stylez Hugging Face. - Napisz funkcję, która wyodrębnia prompt z pola
'content', zakładając, że prompt znajduje się pod indeksem0argumentu wejściowego funkcji. - Zastosuj funkcję wyodrębniającą prompt do podzbioru
'chosen'zbioru danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])