Utvärdera genererad text med ROUGE
Du får 10 sampel från ett fråge-och-svar-dataset (Softage-AI/sft-conversational_dataset).
Du har använt TinyLlama-1.1B för att generera svar på dessa sampel, och din uppgift är att utvärdera kvaliteten på de genererade resultaten jämfört med facit.
Svaren som modellen har genererat finns i test_answers och facit i reference_answers. Använd ROUGE-utvärderingsmåtten för att bedöma kvaliteten på modellens generering.
Den här övningen är en del av kursen
Finjustering med Llama 3
Övningsinstruktioner
- Importera utvärderingsklassen och måttet (ROUGE-måttet).
- Instansiera utvärderingsklassen och läs in ROUGE-måttet.
- Kör utvärderingsinstansen med de givna
reference_answersochtest_answersför att beräkna ROUGE-poängen. - Lagra i
final_scoredet resultat som mäter överlappet av ordpar mellan referenssvaren och de genererade svaren.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)