ÎncepețiÎncepe gratuit

Pregătirea setului de date cu preferințe

În acest exercițiu, vei lucra cu un set de date care conține feedback uman sub forma unor răspunsuri „alese" și „respinse". Sarcina ta este să extragi prompt-urile din coloana "chosen" și să pregătești datele pentru antrenarea unui model de recompensă.

Funcția load_dataset din datasets a fost deja importată.

Acest exercițiu face parte din cursul

Reinforcement Learning from Human Feedback (RLHF)

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă setul de date trl-internal-testing/hh-rlhf-helpful-base-trl-style de la Hugging Face.
  • Scrie o funcție care extrage prompt-ul din câmpul 'content', presupunând că prompt-ul se află la indexul 0 al intrării în funcție.
  • Aplică funcția de extragere a prompt-ului pe subsetul 'chosen' al setului de date.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
Editează și rulează codul