नकारात्मक KL divergence को कम करना
आप RLHF तकनीकों का उपयोग करके मॉडल को फाइन-ट्यून कर रहे थे और देखा कि बेस मॉडल की तुलना में प्रदर्शन खराब हो गया है। आपको संदेह है कि यह नकारात्मक KL divergence के कारण है, इसलिए आप इस समस्या को रोकने के लिए सही जनरेशन पैरामीटर सेट करना चाहते हैं।
tokenizer पहले से इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
top_kऔरmin_lengthको ऐसे मान दें जो KL divergence से बचने में मदद करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
generation_kwargs = {
# Set min length and top k parameters
____,
"top_p": 1.0,
"do_sample": True,
"pad_token_id": tokenizer.eos_token_id,
"max_new_tokens": 32}