शुरू करेंमुफ़्त में शुरू करें

नकारात्मक KL divergence को कम करना

आप RLHF तकनीकों का उपयोग करके मॉडल को फाइन-ट्यून कर रहे थे और देखा कि बेस मॉडल की तुलना में प्रदर्शन खराब हो गया है। आपको संदेह है कि यह नकारात्मक KL divergence के कारण है, इसलिए आप इस समस्या को रोकने के लिए सही जनरेशन पैरामीटर सेट करना चाहते हैं।

tokenizer पहले से इम्पोर्ट किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • top_k और min_length को ऐसे मान दें जो KL divergence से बचने में मदद करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

generation_kwargs = {
    # Set min length and top k parameters
    ____, 
  	"top_p": 1.0,
  	"do_sample": True,  
  	"pad_token_id": tokenizer.eos_token_id, 
  	"max_new_tokens": 32}
कोड संपादित करें और चलाएँ