प्रेफ़रेंस डेटासेट तैयार करना
इस अभ्यास में, आप एक ऐसे डेटासेट के साथ काम करेंगे जिसमें मानव फीडबैक "chosen" और "rejected" आउटपुट के रूप में दिया गया है. आपका काम "chosen" कॉलम से प्रॉम्प्ट निकालना और रिवॉर्ड मॉडल के प्रशिक्षण के लिए डेटा तैयार करना है.
datasets की load_dataset फंक्शन पहले से इम्पोर्ट की गई है
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
- Hugging Face से
trl-internal-testing/hh-rlhf-helpful-base-trl-styleडेटासेट लोड करें. - एक फंक्शन लिखें जो
'content'फ़ील्ड से प्रॉम्प्ट निकाले, यह मानते हुए कि प्रॉम्प्ट उस फंक्शन के इनपुट के इंडेक्स0पर मिलता है. - जिस फंक्शन से प्रॉम्प्ट निकाला जाता है, उसे
'chosen'डेटासेट सबसेट पर लागू करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the dataset
preference_data = ____
# Define a function to extract the prompt
def extract_prompt(text):
____
return prompt
# Apply the function to the dataset
preference_data_with_prompt = ____(
lambda sample: {**sample, 'prompt': ____(sample['chosen'])}
)
sample = preference_data_with_prompt.select(range(1))
print(sample['prompt'])