शुरू करेंमुफ़्त में शुरू करें

रिवॉर्ड मॉडल की जाँच

आप मॉडल को फिर से फाइन-ट्यून करने लौटते हैं और देखते हैं कि मॉडल का परफॉर्मेंस अभी भी बेस मॉडल की तुलना में कमज़ोर है। इस बार, आप रिवॉर्ड मॉडल को जाँचना चाहते हैं, और आपने मॉडल से प्राप्त परिणामों का एक डेटासेट तैयार किया है जिसे आप विश्लेषित करेंगे। आउटपुट डेटा पर आप कौन-कौन से चेक करेंगे?

डेटासेट पहले से reward_model_results के रूप में इंपोर्ट किया गया है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें