Применение метрик из библиотеки evaluate
Пришло время оценить языковую модель, классифицирующую обращения в службу поддержки. Продолжая работу с дообученной моделью, вы воспользуетесь новым валидационным набором данных, чтобы проверить её качество.
Несколько обращений и соответствующие им метки уже загружены в переменные validate_text и validate_labels. Модель model и токенизатор tokenizer также доступны.
Это упражнение является частью курса
Введение в LLM на Python
Инструкции к упражнению
- Извлеките предсказанные метки из логитов модели, хранящихся в
outputs. - Вычислите четыре загруженные метрики, сравнив истинные метки (
validate_labels) с предсказанными.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))