शुरू करेंमुफ़्त में शुरू करें

ROUGE का उपयोग करके जनरेट किए गए टेक्स्ट का मूल्यांकन करें

आपको एक क्वेश्चन-आंसरिंग डेटासेट (Softage-AI/sft-conversational_dataset) से 10 सैंपल दिए गए हैं.

आपने TinyLlama-1.1B का उपयोग करके इन सैंपल के उत्तर जनरेट किए हैं, और आपका कार्य इन जनरेट किए गए परिणामों की गुणवत्ता का ग्राउंड ट्रुथ से मूल्यांकन करना है.

इस मॉडल द्वारा जनरेट किए गए उत्तर test_answers में दिए गए हैं और ग्राउंड ट्रुथ reference_answers में. मॉडल की जनरेशन की गुणवत्ता आंकने के लिए ROUGE इवैल्यूएशन मेट्रिक्स का उपयोग करें.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Llama 3 के साथ फाइन-ट्यूनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • इवैल्यूएशन क्लास और मेट्रिक (ROUGE मेट्रिक) इम्पोर्ट करें.
  • इवैल्यूएशन क्लास को इंस्टैंशिएट करें और ROUGE मेट्रिक लोड करें.
  • दिए गए reference_answers और test_answers के साथ इवैल्युएटर इंस्टेंस चलाएँ ताकि ROUGE स्कोर compute हो सकें.
  • नतीजों में से उस स्कोर को final_score में स्टोर करें जो रेफरेंस और जनरेटेड उत्तरों के बीच word pairs के ओवरलैप की जाँच करता है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
कोड संपादित करें और चलाएँ