Pregătirea setului de date cu preferințe
În acest exercițiu, vei lucra cu un set de date care conține feedback uman sub forma unor răspunsuri „alese" și „respinse". Sarcina ta este să extragi prompt-urile din coloana "chosen" și să pregătești datele pentru antrenarea unui model de recompensă.
Funcția load_dataset din datasets a fost deja importată.
Acest exercițiu face parte din cursul
Reinforcement Learning from Human Feedback (RLHF)
Instrucțiuni pentru exercițiu
- Încarcă setul de date
trl-internal-testing/hh-rlhf-helpful-base-trl-stylede la Hugging Face. - Scrie o funcție care extrage prompt-ul din câmpul
'content', presupunând că prompt-ul se află la indexul0al intrării în funcție. - Aplică funcția de extragere a prompt-ului pe subsetul
'chosen'al setului de date.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])