शुरू करेंमुफ़्त में शुरू करें

प्रेफ़रेंस डेटासेट तैयार करना

इस अभ्यास में, आप एक ऐसे डेटासेट के साथ काम करेंगे जिसमें मानव फीडबैक "chosen" और "rejected" आउटपुट के रूप में दिया गया है. आपका काम "chosen" कॉलम से प्रॉम्प्ट निकालना और रिवॉर्ड मॉडल के प्रशिक्षण के लिए डेटा तैयार करना है.

datasets की load_dataset फंक्शन पहले से इम्पोर्ट की गई है

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Hugging Face से trl-internal-testing/hh-rlhf-helpful-base-trl-style डेटासेट लोड करें.
  • एक फंक्शन लिखें जो 'content' फ़ील्ड से प्रॉम्प्ट निकाले, यह मानते हुए कि प्रॉम्प्ट उस फंक्शन के इनपुट के इंडेक्स 0 पर मिलता है.
  • जिस फंक्शन से प्रॉम्प्ट निकाला जाता है, उसे 'chosen' डेटासेट सबसेट पर लागू करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the dataset
preference_data = ____

# Define a function to extract the prompt
def extract_prompt(text):
    ____
    return prompt

# Apply the function to the dataset 
preference_data_with_prompt = ____(
    lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)

sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])
कोड संपादित करें और चलाएँ