Comece agoraComece grátis

Avalie texto gerado usando ROUGE

Você recebeu 10 amostras de um conjunto de dados de perguntas e respostas (Softage-AI/sft-conversational_dataset).

Você usou o TinyLlama-1.1B para gerar respostas para essas amostras, e sua tarefa é avaliar a qualidade dos resultados gerados em relação ao gabarito (ground truth).

As respostas geradas por esse modelo estão em test_answers e o gabarito em reference_answers. Use as métricas de avaliação ROUGE para avaliar a qualidade da geração do modelo.

Este exercicio faz parte do curso

Ajuste Fino com Llama 3

Ver curso

Instruções do exercicio

  • Importe a classe de avaliação e a métrica (métrica ROUGE).
  • Instancie a classe de avaliação e carregue a métrica ROUGE.
  • Execute a instância do avaliador com reference_answers e test_answers para calcular os escores ROUGE.
  • Armazene, em final_score, o escore dos resultados que verifica a sobreposição de pares de palavras entre as respostas de referência e as geradas.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
Editar e Executar Código