Evaluación de un modelo de generación de texto preentrenado
El equipo de PyBooks ha usado un modelo GPT-2 preentrenado, con el que ya experimentaste, para generar texto a partir de un prompt dado. Ahora quieren evaluar la calidad de ese texto generado. Para ello, te han encargado evaluar el texto generado usando un texto de referencia.
BLEUScore, ROUGEScore ya se han cargado por ti.
Este ejercicio forma parte del curso
Deep Learning para texto con PyTorch
Instrucciones del ejercicio
- Empieza inicializando las dos métricas (BLEU y ROUGE) proporcionadas desde
torchmetrics.text. - Usa estas métricas inicializadas para calcular las puntuaciones entre el texto generado y el texto de referencia.
- Muestra las puntuaciones BLEU y ROUGE calculadas.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
reference_text = "Once upon a time, there was a little girl who lived in a village near the forest."
generated_text = "Once upon a time, the world was a place of great beauty and great danger. The world of the gods was the place where the great gods were born, and where they were to live."
# Initialize BLEU and ROUGE scorers
bleu = ____()
rouge = ____()
# Calculate the BLEU and ROUGE scores
bleu_score = bleu([____], [[reference_text]])
rouge_score = rouge([generated_text], [[____]])
# Print the BLEU and ROUGE scores
print("BLEU Score:", bleu_score.____())
print("ROUGE Score:", rouge_score)