Évaluer avec ROUGE
ROUGE est souvent utilisé pour évaluer les tâches de synthèse, car il vérifie les similarités entre les prédictions et les références. On vous a fourni un résumé généré par le modèle, predictions, ainsi qu'un résumé de references pour la validation. Calculez les scores pour voir la performance du modèle.
La bibliothèque evaluate a été chargée pour vous.
Cette activité fait partie du cours
Introduction aux LLM avec Python
Instructions de l’exercice
- Chargez la mesure ROUGE.
- Calculez les scores ROUGE entre les résumés prédit et de référence.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the rouge metric
rouge = ____
predictions = ["""Pluto is a dwarf planet in our solar system, located in the Kuiper Belt beyond Neptune, and was formerly considered the ninth planet until its reclassification in 2006."""]
references = ["""Pluto is a dwarf planet in the solar system, located in the Kuiper Belt beyond Neptune, and was previously deemed as a planet until it was reclassified in 2006."""]
# Calculate the rouge scores between the predicted and reference summaries
results = ____
print("ROUGE results: ", results)