रिवॉर्ड मॉडल की जाँच
आप मॉडल को फिर से फाइन-ट्यून करने लौटते हैं और देखते हैं कि मॉडल का परफॉर्मेंस अभी भी बेस मॉडल की तुलना में कमज़ोर है। इस बार, आप रिवॉर्ड मॉडल को जाँचना चाहते हैं, और आपने मॉडल से प्राप्त परिणामों का एक डेटासेट तैयार किया है जिसे आप विश्लेषित करेंगे। आउटपुट डेटा पर आप कौन-कौन से चेक करेंगे?
डेटासेट पहले से reward_model_results के रूप में इंपोर्ट किया गया है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें