Začněte nyníZačněte zdarma

Příprava preference datasetu

V tomto cvičení budeš pracovat s datasetem, který obsahuje lidskou zpětnou vazbu ve formě „zvolených" (chosen) a „odmítnutých" (rejected) výstupů. Tvým úkolem je extrahovat prompty ze sloupce „chosen" a připravit data pro trénování reward modelu.

Funkce load_dataset z knihovny datasets je již naimportována.

Toto cvičení je součástí kurzu

Reinforcement Learning from Human Feedback (RLHF)

Zobrazit kurz

Pokyny k cvičení

  • Načti dataset trl-internal-testing/hh-rlhf-helpful-base-trl-style z Hugging Face.
  • Napiš funkci, která extrahuje prompt z pole 'content' – předpokládej, že prompt se nachází na indexu 0 vstupu funkce.
  • Aplikuj funkci pro extrakci promptu na část datasetu 'chosen'.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Upravit a spustit kód