Evaluare cu ROUGE
ROUGE este folosit frecvent pentru evaluarea sarcinilor de sumarizare, deoarece verifică similaritățile dintre predicții și referințe. Ți-au fost furnizate un rezumat generat de model, predictions, și un rezumat de referință, references, pentru validare. Calculează scorurile pentru a vedea cât de bine a performant modelul.
Biblioteca evaluate a fost deja încărcată pentru tine.
Acest exercițiu face parte din cursul
Introducere în LLM-uri cu Python
Instrucțiuni pentru exercițiu
- Încarcă metrica ROUGE.
- Calculează scorurile ROUGE dintre rezumatul prezis și cel de referință.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load the rouge metric
rouge = ____
predictions = ["""Pluto is a dwarf planet in our solar system, located in the Kuiper Belt beyond Neptune, and was formerly considered the ninth planet until its reclassification in 2006."""]
references = ["""Pluto is a dwarf planet in the solar system, located in the Kuiper Belt beyond Neptune, and was previously deemed as a planet until it was reclassified in 2006."""]
# Calculate the rouge scores between the predicted and reference summaries
results = ____
print("ROUGE results: ", results)