Kom igångKom igång gratis

Utvärdera genererad text med ROUGE

Du får 10 sampel från ett fråge-och-svar-dataset (Softage-AI/sft-conversational_dataset).

Du har använt TinyLlama-1.1B för att generera svar på dessa sampel, och din uppgift är att utvärdera kvaliteten på de genererade resultaten jämfört med facit.

Svaren som modellen har genererat finns i test_answers och facit i reference_answers. Använd ROUGE-utvärderingsmåtten för att bedöma kvaliteten på modellens generering.

Den här övningen är en del av kursen

Finjustering med Llama 3

Visa kurs

Övningsinstruktioner

  • Importera utvärderingsklassen och måttet (ROUGE-måttet).
  • Instansiera utvärderingsklassen och läs in ROUGE-måttet.
  • Kör utvärderingsinstansen med de givna reference_answers och test_answers för att beräkna ROUGE-poängen.
  • Lagra i final_score det resultat som mäter överlappet av ordpar mellan referenssvaren och de genererade svaren.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
Redigera och kör kod