Použití evaluate metrik
Přišel čas vyhodnotit svůj LLM, který klasifikuje interakce zákaznické podpory. Navážeš na svůj doladěný model a použiješ novou validační datovou sadu k posouzení jeho výkonu.
Některé interakce a jejich odpovídající štítky jsou načtené jako validate_text a validate_labels. K dispozici máš také model a tokenizer.
Toto cvičení je součástí kurzu
Úvod do LLMs v Pythonu
Pokyny k cvičení
- Z logitů modelu obsažených v
outputsextrahuj predikované štítky. - Spočítej čtyři načtené metriky porovnáním skutečných (
validate_labels) a predikovaných štítků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")
# Extract the new predictions
predicted_labels = ____
# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))