Оценка сгенерированного текста с помощью ROUGE
Вам предоставлены 10 образцов из набора данных для ответов на вопросы (Softage-AI/sft-conversational_dataset).
Вы использовали модель TinyLlama-1.1B для генерации ответов на эти образцы. Ваша задача — оценить качество сгенерированных ответов в сравнении с эталонными.
Ответы, сгенерированные моделью, хранятся в test_answers, а эталонные ответы — в reference_answers. Используйте метрики оценки ROUGE, чтобы определить качество генерации модели.
Это упражнение является частью курса
Файн-тюнинг с Llama 3
Инструкции к упражнению
- Импортируйте класс оценки и метрику (метрику ROUGE).
- Создайте экземпляр класса оценки и загрузите метрику ROUGE.
- Запустите экземпляр оценщика, передав
reference_answersиtest_answers, чтобы вычислить оценки ROUGE. - Сохраните в переменной
final_scoreоценку из результатов, которая проверяет совпадение пар слов между эталонными и сгенерированными ответами.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the evaluation library from Hugging Face
import ____
# Instantiate your evaluate library and load the ROUGE metric
rouge_evaluator = ____.load(____)
# Fill in the method, and place your reference answers and test answers
results = rouge_evaluator.____
# Extract the ROUGE1 score from the results dictionary
final_score = results[____]
print(final_score)