Příprava preference datasetu
V tomto cvičení budeš pracovat s datasetem, který obsahuje lidskou zpětnou vazbu ve formě „zvolených" (chosen) a „odmítnutých" (rejected) výstupů. Tvým úkolem je extrahovat prompty ze sloupce „chosen" a připravit data pro trénování reward modelu.
Funkce load_dataset z knihovny datasets je již naimportována.
Toto cvičení je součástí kurzu
Reinforcement Learning from Human Feedback (RLHF)
Pokyny k cvičení
- Načti dataset
trl-internal-testing/hh-rlhf-helpful-base-trl-stylez Hugging Face. - Napiš funkci, která extrahuje prompt z pole
'content'– předpokládej, že prompt se nachází na indexu0vstupu funkce. - Aplikuj funkci pro extrakci promptu na část datasetu
'chosen'.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])