Avalie texto gerado usando ROUGE
Você recebeu 10 amostras de um conjunto de dados de perguntas e respostas (Softage-AI/sft-conversational_dataset).
Você usou o TinyLlama-1.1B para gerar respostas para essas amostras, e sua tarefa é avaliar a qualidade dos resultados gerados em relação ao gabarito (ground truth).
As respostas geradas por esse modelo estão em test_answers e o gabarito em reference_answers. Use as métricas de avaliação ROUGE para avaliar a qualidade da geração do modelo.
Este exercicio faz parte do curso
Ajuste Fino com Llama 3
Instruções do exercicio
- Importe a classe de avaliação e a métrica (métrica ROUGE).
- Instancie a classe de avaliação e carregue a métrica ROUGE.
- Execute a instância do avaliador com
reference_answersetest_answerspara calcular os escores ROUGE. - Armazene, em
final_score, o escore dos resultados que verifica a sobreposição de pares de palavras entre as respostas de referência e as geradas.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)