Korzystanie z metryk biblioteki evaluate
Czas ocenić działanie modelu LLM klasyfikującego zgłoszenia do obsługi klienta. Kontynuując pracę z wytrenowanym modelem, użyjesz teraz nowego zbioru walidacyjnego, aby sprawdzić jego wydajność.
Niektóre zgłoszenia i odpowiadające im etykiety zostały już wczytane jako validate_text i validate_labels. Model (model) i tokenizer (tokenizer) są również dostępne.
To ćwiczenie jest częścią kursu
Wprowadzenie do LLM w Pythonie
Instrukcje do ćwiczenia
- Wyodrębnij przewidywane etykiety z logitów modelu zawartych w
outputs. - Oblicz cztery wczytane metryki, porównując prawdziwe etykiety (
validate_labels) z przewidywanymi.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))