Začněte nyníZačněte zdarma

Použití evaluate metrik

Přišel čas vyhodnotit svůj LLM, který klasifikuje interakce zákaznické podpory. Navážeš na svůj doladěný model a použiješ novou validační datovou sadu k posouzení jeho výkonu.

Některé interakce a jejich odpovídající štítky jsou načtené jako validate_text a validate_labels. K dispozici máš také model a tokenizer.

Toto cvičení je součástí kurzu

Úvod do LLMs v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Z logitů modelu obsažených v outputs extrahuj predikované štítky.
  • Spočítej čtyři načtené metriky porovnáním skutečných (validate_labels) a predikovaných štítků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

accuracy = evaluate.load("accuracy")
precision = evaluate.load("precision")
recall = evaluate.load("recall")
f1 = evaluate.load("f1")

# Extract the new predictions
predicted_labels = ____

# Compute the metrics by comparing real and predicted labels
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
print(____(____=____, predictions=predicted_labels))
Upravit a spustit kód