Kom igångKom igång gratis

Förbereda preferensdatamängden

I den här övningen arbetar du med en datamängd som innehåller mänsklig feedback i form av "chosen"- och "rejected"-utdata. Din uppgift är att extrahera prompterna från kolumnen "chosen" och förbereda data för träning av en belöningsmodell.

Funktionen load_dataset från datasets har importerats i förväg.

Den här övningen är en del av kursen

Reinforcement Learning from Human Feedback (RLHF)

Visa kurs

Övningsinstruktioner

  • Ladda datamängden trl-internal-testing/hh-rlhf-helpful-base-trl-style från Hugging Face.
  • Skriv en funktion som extraherar prompten från fältet 'content', med antagandet att prompten finns på index 0 i funktionens indata.
  • Tillämpa funktionen som extraherar prompten på datamängdens delmängd 'chosen'.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Redigera och kör kod