НачатьНачать бесплатно

Оценка сгенерированного текста с помощью ROUGE

Вам предоставлены 10 образцов из набора данных для ответов на вопросы (Softage-AI/sft-conversational_dataset).

Вы использовали модель TinyLlama-1.1B для генерации ответов на эти образцы. Ваша задача — оценить качество сгенерированных ответов в сравнении с эталонными.

Ответы, сгенерированные моделью, хранятся в test_answers, а эталонные ответы — в reference_answers. Используйте метрики оценки ROUGE, чтобы определить качество генерации модели.

Это упражнение является частью курса

Файн-тюнинг с Llama 3

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс оценки и метрику (метрику ROUGE).
  • Создайте экземпляр класса оценки и загрузите метрику ROUGE.
  • Запустите экземпляр оценщика, передав reference_answers и test_answers, чтобы вычислить оценки ROUGE.
  • Сохраните в переменной final_score оценку из результатов, которая проверяет совпадение пар слов между эталонными и сгенерированными ответами.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the evaluation library from Hugging Face
import ____ 

# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____) 

# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____

# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)
Редактировать и запускать код