RLHF के साथ टेक्स्ट जनरेशन
इस अभ्यास में, आप RLHF से प्री-ट्रेन किए गए मॉडल lvwerra/gpt2-imdb-pos-v2 के साथ काम करेंगे। यह अभ्यास Hugging Face पाइपलाइन बनाना दोहराने और इसे RLHF-ट्रेन किए गए मॉडलों के एक उपयोग-केस को जाँचने के लिए इस्तेमाल करने का मौका है: मूवी रिव्यू जनरेट करना।
pipeline, AutoModelForCausalLM, और AutoTokenizer ऑब्जेक्ट्स पहले से transformers से प्री-इम्पोर्ट किए गए हैं। tokenizer पहले से प्री-लोडेड है
यह अभ्यास पाठ्यक्रम का हिस्सा है
मानवीय फीडबैक से रिइनफोर्समेंट लर्निंग (RLHF)
अभ्यास निर्देश
- मॉडल का नाम
lvwerra/gpt2-imdb-pos-v2रखें, जो RLHF-प्री-ट्रेन किया गया मॉडल है. pipelineफंक्शन का उपयोग करके एकtext-generationपाइपलाइन बनाएँ.- दिए गए रिव्यू की कंटिन्युएशन जनरेट करने के लिए इस टेक्स्ट जनरेशन पाइपलाइन का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Set the model name
model_name = ____
model = AutoModelForCausalLM.from_pretrained(model_name)
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Create a text generation pipeline
text_generator = pipeline(____, model=model, tokenizer=tokenizer)
review_prompt = "Surprisingly, the film"
# Generate a continuation of the review
generated_text = text_generator(____, max_length=10)
print(f"Generated Review Continuation: {generated_text[0]['generated_text']}")